AI 開發者工具
Caliper
用於AI代理技能的開源可靠性測試工具,計算Claude Code、Codex和Pi後端的pass@k分數。
Caliper
什麼是 Caliper?
Caliper 是一個開源的CLI和代理技能,通過多次運行並計算 pass@k 分數來衡量AI代理技能的可靠性,支援Claude Code、Codex、Pi和API後端。
Caliper 與相似工具比較
| 計價模式 | 免費 | 免費 | 客製化定價 | 免費, 付費 |
| 免費額度 | ||||
| 主要功能 |
|
|
|
|
| 優點 |
|
|
|
|
| 缺點 |
|
|
|
|
| 適合對象 |
|
|
|
|
如何使用 Caliper?
- 1透過 pipx 安裝:pipx install caliper-eval
- 2撰寫一個 .eval.yaml 規範,包含任務、提示詞和預期結果
- 3執行評估:caliper run my-skill.eval.yaml --k 3 --baseline
- 4或使用代理技能:/evaluate-skill run my-skill.eval.yaml --k 3 --baseline
Caliper 主要功能
- 可配置 k 值的 pass@k 可靠性評分
- 無技能的基線比較以證明差異
- LLM 評判(expect:)和確定性 Python 斷言(assert:)
- 多後端支援:Claude Code、Codex、Pi、Claude API、OpenAI API
- 可配置工作者的並行任務執行
- 用於工作流程中的代理技能(evaluate-skill、grill-skill)
- 將結果儲存為 JSON 以進行歷史追蹤
- 使用 grill-skill 進行互動式規範生成
Caliper 使用情境
- 驗證技能是否確實比基線提升代理效能
- 跨模型更新和提示詞變更追蹤可靠性
- 比較哪個代理後端更可靠地運行技能
- 迭代技能提示詞並獲得可衡量的改進
Caliper 價格與免費點數
Caliper 目前採用 免費 模式。
Caliper 優缺點
優點
- 可重複的量化可靠性分數
- 開箱即用,支援多種代理後端
- 透過基線將技能貢獻與基礎代理分離
- 同時支援基於 LLM 和確定性的評判
- 代理技能允許在 Claude Code/Codex 中執行評估
缺點
- 需要 CLI 設定和代理特定依賴項
- LLM 評判在主觀任務上可能不一致
- 沒有針對非代理工作流程的內建測試套件
- 自訂斷言輔助程式的文件有限
Caliper 最適合哪些用途?
- 建置和維護代理技能的開發者
- 需要衡量跨運行代理技能可靠性的團隊