AI 开发者工具
Caliper
开源的AI智能体技能可靠性测试工具,计算Claude Code、Codex和Pi后端的pass@k分数。
Caliper
什么是 Caliper?
Caliper是一个开源CLI和智能体技能,通过多次运行并计算pass@k分数来评估AI智能体技能的可靠性,支持Claude Code、Codex、Pi和API后端。
Caliper 与相似工具比较
| 计价模式 | 免费 | 免费 | 定制定价 | 免费, 付费 |
| 免费额度 | ||||
| 主要功能 |
|
|
|
|
| 优点 |
|
|
|
|
| 缺点 |
|
|
|
|
| 适合对象 |
|
|
|
|
如何使用 Caliper?
- 1通过pipx安装:pipx install caliper-eval
- 2编写.eval.yaml规范,包含任务、提示词和预期结果
- 3运行评估:caliper run my-skill.eval.yaml --k 3 --baseline
- 4或使用智能体技能:/evaluate-skill run my-skill.eval.yaml --k 3 --baseline
Caliper 主要功能
- 可配置k值的pass@k可靠性评分
- 无技能基线比较以证明性能增量
- LLM评判(expect:)和确定性Python断言(assert:)
- 多后端支持:Claude Code、Codex、Pi、Claude API、OpenAI API
- 可配置工作进程的并行任务执行
- 工作流内使用的智能体技能(evaluate-skill、grill-skill)
- 结果为JSON格式,便于历史追踪
- 使用grill-skill进行交互式规范生成
Caliper 使用场景
- 验证技能是否确实提升了智能体相对于基线的性能
- 追踪模型更新和提示词变化对可靠性的影响
- 比较哪个智能体后端运行技能更可靠
- 迭代技能提示词,实现可衡量的改进
Caliper 价格与免费额度
Caliper 目前采用 免费 模式。
此工具完全免费使用
Caliper 优缺点
优点
- 可重复、定量的可靠性评分
- 开箱即用支持多种智能体后端
- 通过基线分离技能贡献与基础智能体
- 同时支持基于LLM和确定性的评判
- 智能体技能允许在Claude Code/Codex内运行评估
缺点
- 需要CLI设置和特定智能体的依赖
- LLM评判在主观任务上可能不一致
- 没有针对非智能体工作流的内置测试套件
- 自定义断言助手的文档有限
Caliper 最适合哪些用途?
- 构建和维护智能体技能的开发者
- 需要跨运行衡量智能体技能可靠性的团队