AI開発者ツール

Caliper

オープンソースの信頼性テストハーネス。Claude Code、Codex、PiバックエンドでAIエージェントスキルのpass@kスコアを計算します。

Caliperとは

Caliperは、AIエージェントスキルの信頼性を測定するオープンソースのCLIおよびエージェントスキルです。スキルを複数回実行し、pass@kスコアを計算します。Claude Code、Codex、Pi、APIバックエンドをサポートしています。

Caliperと類似AIツールの比較

料金モデル無料無料無料無料
無料クレジット
主な機能
  • pass@k信頼性スコアリング(kを設定可能)
  • スキルなしのベースライン比較でデルタを証明
  • LLM判定(expect:)と決定論的Pythonアサーション(assert:)
  • OWASP Agentic Top-10脆弱性をカバーする7つのブレイク可能ボックス
  • カスケード障害、人間-エージェント信頼、不正エージェントのための3つのガイド付きシミュレーション
  • 安全な実行のためのネットワーク分離Dockerコンテナ
  • クラウド、Git、Kubernetes全体でのコードからランタイムへの推論
  • アクションゲートがすべてのAPI呼び出しに読み取り専用ポリシーを適用
  • 同時調査のためのサンドボックス化されたJavaScript実行
  • Jaybaseによる追加専用、SHA-256アドレス指定のイベント履歴
  • 保存されたノードペイロードのAES-256-GCM暗号化
  • 元帳、メモ、スナップショット、監査読み取りのための統合RBAC
メリット
  • 再現可能で定量的な信頼性スコア
  • 複数のエージェントバックエンドをすぐにサポート
  • OWASP Agentic Top-10を現実的にカバー
  • Docker分離による偶発的損傷の防止
  • 設計上読み取り専用で偶発的な書き込みを防止
  • エビデンスに基づく検証がすべての発見を相互チェック
  • 不変の監査証跡を備えた、意見を持った安全な会計CLI
  • JSON出力によるAIエージェント統合向けに設計
注意点
  • CLIのセットアップとエージェント固有の依存関係が必要
  • LLM判定は主観的なタスクで一貫性がない可能性あり
  • Dockerと技術的なセットアップが必要
  • 本番環境では使用不可、ラボ環境専用
  • LLMのAPIキーが必要で、トークンコストが発生する
  • 読み取り専用操作に限定され、修復はできない
  • プレ1.0、機能セットが限定的
  • ネイティブのQuickBooksインポートなし(エージェントがデータを正規化する必要あり)
おすすめの人
  • エージェントスキルを構築・維持する開発者
  • 実行間のエージェントスキル信頼性を測定する必要があるチーム
  • AIエージェント脆弱性に焦点を当てたセキュリティ研究者
  • MCPベースのアプリケーションを開発する開発者
  • セキュリティエンジニア
  • DevOpsチーム
  • AIエージェントサポート付きの安全で監査可能な会計を必要とする小規模チーム
  • 自動化された簿記ワークフローを統合する開発者

Caliperの使い方

  1. 1pipxでインストール: pipx install caliper-eval
  2. 2.eval.yaml仕様ファイルを作成(タスク、プロンプト、期待される結果を記述)
  3. 3評価を実行: caliper run my-skill.eval.yaml --k 3 --baseline
  4. 4またはエージェントスキルを使用: /evaluate-skill run my-skill.eval.yaml --k 3 --baseline

Caliperの主な機能

  • pass@k信頼性スコアリング(kを設定可能)
  • スキルなしのベースライン比較でデルタを証明
  • LLM判定(expect:)と決定論的Pythonアサーション(assert:)
  • 複数バックエンド対応:Claude Code、Codex、Pi、Claude API、OpenAI API
  • 並列タスク実行(ワーカー数設定可能)
  • ワークフロー内で使用可能なエージェントスキル(evaluate-skill、grill-skill)
  • 履歴追跡のためのJSON結果保存
  • grill-skillによるインタラクティブな仕様生成

Caliperのユースケース

  • スキルが実際にエージェントのパフォーマンスをベースラインより向上させるかを検証
  • モデル更新やプロンプト変更に伴う信頼性の追跡
  • どのエージェントバックエンドがスキルをより確実に実行するかを比較
  • 測定可能な改善を伴うスキルプロンプトの反復改善

Caliperの料金と無料枠

Caliper の料金モデルは 無料 です。

このツールは完全に無料で利用できます

オープンソース

無料

MITライセンス、GitHubおよびPyPIで利用可能

Caliperのメリット・注意点

メリット

  • 再現可能で定量的な信頼性スコア
  • 複数のエージェントバックエンドをすぐにサポート
  • ベースラインにより、スキルの貢献を基本エージェントから分離
  • LLMベースおよび決定論的判定の両方をサポート
  • エージェントスキルにより、Claude Code/Codex内で評価を実行可能

注意点

  • CLIのセットアップとエージェント固有の依存関係が必要
  • LLM判定は主観的なタスクで一貫性がない可能性あり
  • 非エージェントワークフロー向けの組み込みテストスイートがない
  • カスタムアサーションヘルパーのドキュメントが限定的

Caliper はどんな用途に向いていますか?

  • エージェントスキルを構築・維持する開発者
  • 実行間のエージェントスキル信頼性を測定する必要があるチーム

Caliperのよくある質問

Caliper の無料代替ツール

Openbase logo

音声操作可能なIDEで、開発者がCodexやClaude Codeを使ってAIコーディングセッションを開始し、コマンドを承認し、スマートフォンから差分を確認できるようにします。

無料
SureWire logo

SureWireは、AIエージェントの安全性、信頼性、コンプライアンスを専用のテストエージェントでストレステストする専門的なQAプラットフォームです。

無料
Notte logo

AIエージェントがクラウドブラウザセッション、エージェント、サーバーレス機能を使って高速にインターネット上で動作するためのブラウザインフラストラクチャプラットフォーム。

無料
YAFL logo

エージェント向けファイル転送ツール。MCP呼び出しを介してAIエージェント間で暗号化されたファイル共有を実現し、人間の介入は不要です。

無料
Manifest logo

Manifestは、任意のURLを、AIエージェントがページ上で操作できるボタン、フォーム、入力フィールド、必須項目などの構造化されたJSONマップに変換します。

無料
B

Basertによる個人のGitHub Pagesサイトで、現在はデフォルトのウェルカムコンテンツとJekyllを使ったGitHub Pagesの使用方法の説明を表示しています。

無料
Termaxa logo

AIエージェントが実行するシェルコマンドの協調ゲートで、Claude CodeやCursorなどのツールにプレビュー、バックアップ、ポリシー適用、監査を提供します。

無料
Agentcard logo

Agentcardは、AIエージェント向けにエージェントフレンドリーなカード発行と決済インフラを提供し、5分でのセットアップと自律的な購入を可能にします。

無料

Caliper の代替AIツール

mcploitable logo

エージェントセキュリティトレーニングのための意図的に脆弱性を含むMCPサーバーのコレクション。OWASP Top 10 for Agentic Applicationsに対応。

Cynative logo

コード、クラウド、ランタイム全体で最先端モデルを実行し、検証済みの回答を提供する、ディープインフラストラクチャリサーチのためのオープンソースAIツール。

Magpie logo

Magpieは、人間とAIエージェント向けの意見を持った会計CLIであり、RBACとJaybase上の不変イベントストレージを備えた複式簿記を提供します。

agent-manager logo

AIコーディングエージェントセッション(Claude Code、OpenCode、Codex、Grok Build)をtmuxで管理するターミナルUI。ライブステータス、グループツリー、差分レビューを備えています。

Openbase logo

音声操作可能なIDEで、開発者がCodexやClaude Codeを使ってAIコーディングセッションを開始し、コマンドを承認し、スマートフォンから差分を確認できるようにします。

無料
OpsCat logo

ゼロ設定、シングルバイナリのソフトウェアカタログ。自動検出、依存関係の可視化、コンプライアンススコアカード、およびAIエージェント向けのネイティブMCP統合を提供します。

BrowserAct Skills logo

AIエージェント向けブラウザ自動化CLI。アンチボット対策を回避し、人間への引き継ぎや並列タスク実行を可能にします。

lee-ai logo

AIを搭載したショッパーアシスタントで、ライブカーソルを提供し、ウェブサイト訪問者をガイドし、製品を指し示し、価格計算を表示します。