AI開発者ツール
Caliper
オープンソースの信頼性テストハーネス。Claude Code、Codex、PiバックエンドでAIエージェントスキルのpass@kスコアを計算します。
Caliper
Caliperとは
Caliperは、AIエージェントスキルの信頼性を測定するオープンソースのCLIおよびエージェントスキルです。スキルを複数回実行し、pass@kスコアを計算します。Claude Code、Codex、Pi、APIバックエンドをサポートしています。
Caliperと類似AIツールの比較
| 料金モデル | 無料 | 無料 | カスタム料金 | 無料, 有料 |
| 無料クレジット | ||||
| 主な機能 |
|
|
|
|
| メリット |
|
|
|
|
| 注意点 |
|
|
|
|
| おすすめの人 |
|
|
|
|
Caliperの使い方
- 1pipxでインストール: pipx install caliper-eval
- 2.eval.yaml仕様ファイルを作成(タスク、プロンプト、期待される結果を記述)
- 3評価を実行: caliper run my-skill.eval.yaml --k 3 --baseline
- 4またはエージェントスキルを使用: /evaluate-skill run my-skill.eval.yaml --k 3 --baseline
Caliperの主な機能
- pass@k信頼性スコアリング(kを設定可能)
- スキルなしのベースライン比較でデルタを証明
- LLM判定(expect:)と決定論的Pythonアサーション(assert:)
- 複数バックエンド対応:Claude Code、Codex、Pi、Claude API、OpenAI API
- 並列タスク実行(ワーカー数設定可能)
- ワークフロー内で使用可能なエージェントスキル(evaluate-skill、grill-skill)
- 履歴追跡のためのJSON結果保存
- grill-skillによるインタラクティブな仕様生成
Caliperのユースケース
- スキルが実際にエージェントのパフォーマンスをベースラインより向上させるかを検証
- モデル更新やプロンプト変更に伴う信頼性の追跡
- どのエージェントバックエンドがスキルをより確実に実行するかを比較
- 測定可能な改善を伴うスキルプロンプトの反復改善
Caliperの料金と無料枠
Caliper の料金モデルは 無料 です。
このツールは完全に無料で利用できます
Caliperのメリット・注意点
メリット
- 再現可能で定量的な信頼性スコア
- 複数のエージェントバックエンドをすぐにサポート
- ベースラインにより、スキルの貢献を基本エージェントから分離
- LLMベースおよび決定論的判定の両方をサポート
- エージェントスキルにより、Claude Code/Codex内で評価を実行可能
注意点
- CLIのセットアップとエージェント固有の依存関係が必要
- LLM判定は主観的なタスクで一貫性がない可能性あり
- 非エージェントワークフロー向けの組み込みテストスイートがない
- カスタムアサーションヘルパーのドキュメントが限定的
Caliper はどんな用途に向いていますか?
- エージェントスキルを構築・維持する開発者
- 実行間のエージェントスキル信頼性を測定する必要があるチーム