AI開発者ツール

Caliper

オープンソースの信頼性テストハーネス。Claude Code、Codex、PiバックエンドでAIエージェントスキルのpass@kスコアを計算します。

Caliperとは

Caliperは、AIエージェントスキルの信頼性を測定するオープンソースのCLIおよびエージェントスキルです。スキルを複数回実行し、pass@kスコアを計算します。Claude Code、Codex、Pi、APIバックエンドをサポートしています。

Caliperと類似AIツールの比較

料金モデル無料無料カスタム料金無料, 有料
無料クレジット
主な機能
  • pass@k信頼性スコアリング(kを設定可能)
  • スキルなしのベースライン比較でデルタを証明
  • LLM判定(expect:)と決定論的Pythonアサーション(assert:)
  • GitHub Pagesホスティング
  • Jekyll統合
  • Markdownコンテンツサポート
  • ワークロード監視と異常検出
  • 低速クエリの特定と最適化
  • 自然言語クエリからSQLへの変換
  • ATRルールに基づいてスキルとMCPサーバーをロード前にスキャン
  • プロンプトインジェクションや乗っ取りに対するリアルタイムランタイム保護
  • コンプライアンス対応の署名済み監査証拠(EU AI Act、NYDFS、DORA)
メリット
  • 再現可能で定量的な信頼性スコア
  • 複数のエージェントバックエンドをすぐにサポート
  • カスタムドメイン対応の無料ホスティング
  • Git経由の簡単なセットアップ
  • 1行のコマンドで15分での簡単インストールとセットアップ
  • 自己ホスト型によりデータがインフラ内に留まる
  • MITライセンスのオープンソース
  • リアルタイムの検出と防止
注意点
  • CLIのセットアップとエージェント固有の依存関係が必要
  • LLM判定は主観的なタスクで一貫性がない可能性あり
  • 静的コンテンツに限定
  • サーバーサイド処理なし
  • 自己ホスト型とVPCセットアップが必要
  • 無料トライアルや無料枠の記載なし
  • エンタープライズ機能は有料版が必要
  • セットアップには技術的専門知識が必要
おすすめの人
  • エージェントスキルを構築・維持する開発者
  • 実行間のエージェントスキル信頼性を測定する必要があるチーム
  • 開発者
  • オープンソースプロジェクト
  • データベース管理者
  • データエンジニア
  • AIエージェントを構築・展開する開発者
  • 監査対応のAIセキュリティを必要とする企業

Caliperの使い方

  1. 1pipxでインストール: pipx install caliper-eval
  2. 2.eval.yaml仕様ファイルを作成(タスク、プロンプト、期待される結果を記述)
  3. 3評価を実行: caliper run my-skill.eval.yaml --k 3 --baseline
  4. 4またはエージェントスキルを使用: /evaluate-skill run my-skill.eval.yaml --k 3 --baseline

Caliperの主な機能

  • pass@k信頼性スコアリング(kを設定可能)
  • スキルなしのベースライン比較でデルタを証明
  • LLM判定(expect:)と決定論的Pythonアサーション(assert:)
  • 複数バックエンド対応:Claude Code、Codex、Pi、Claude API、OpenAI API
  • 並列タスク実行(ワーカー数設定可能)
  • ワークフロー内で使用可能なエージェントスキル(evaluate-skill、grill-skill)
  • 履歴追跡のためのJSON結果保存
  • grill-skillによるインタラクティブな仕様生成

Caliperのユースケース

  • スキルが実際にエージェントのパフォーマンスをベースラインより向上させるかを検証
  • モデル更新やプロンプト変更に伴う信頼性の追跡
  • どのエージェントバックエンドがスキルをより確実に実行するかを比較
  • 測定可能な改善を伴うスキルプロンプトの反復改善

Caliperの料金と無料枠

Caliper の料金モデルは 無料 です。

このツールは完全に無料で利用できます

オープンソース

無料

MITライセンス、GitHubおよびPyPIで利用可能

Caliperのメリット・注意点

メリット

  • 再現可能で定量的な信頼性スコア
  • 複数のエージェントバックエンドをすぐにサポート
  • ベースラインにより、スキルの貢献を基本エージェントから分離
  • LLMベースおよび決定論的判定の両方をサポート
  • エージェントスキルにより、Claude Code/Codex内で評価を実行可能

注意点

  • CLIのセットアップとエージェント固有の依存関係が必要
  • LLM判定は主観的なタスクで一貫性がない可能性あり
  • 非エージェントワークフロー向けの組み込みテストスイートがない
  • カスタムアサーションヘルパーのドキュメントが限定的

Caliper はどんな用途に向いていますか?

  • エージェントスキルを構築・維持する開発者
  • 実行間のエージェントスキル信頼性を測定する必要があるチーム

Caliperのよくある質問

Caliper の無料代替ツール

B

Basertによる個人のGitHub Pagesサイトで、現在はデフォルトのウェルカムコンテンツとJekyllを使ったGitHub Pagesの使用方法の説明を表示しています。

無料
Termaxa logo

AIエージェントが実行するシェルコマンドの協調ゲートで、Claude CodeやCursorなどのツールにプレビュー、バックアップ、ポリシー適用、監査を提供します。

無料
Agentcard logo

Agentcardは、AIエージェント向けにエージェントフレンドリーなカード発行と決済インフラを提供し、5分でのセットアップと自律的な購入を可能にします。

無料
Oodle AI logo

Oodle AIは、高速トレース検索、S3ベースのストレージ、そしてAIエージェントのサイレント障害を検出するためのすぐに使えるインサイトを提供するエージェント可観測性ツールです。

無料
Jacquard logo

Jacquardは、機械学習モデルによって記述され、人々によってレビューされるプログラムを実行、レビュー、信頼するために設計された小さなプログラミング言語です。

無料
Perfai Security logo

ライブAIアプリのアクセス制御の脆弱性を発見・修正する自律型セキュリティテストプラットフォーム。

無料
Octolens logo

AI搭載のソーシャルリスニングツール。Reddit、X、LinkedInなど10以上のプラットフォームを監視し、AIでメンションをフィルタリングし、API、Slack、Webhook経由でスタックに配信します。

無料
Opper AI logo

300以上の最先端モデルにアクセスできる統一AIゲートウェイ。EUホスティング、GDPR準拠のAPIで、OpenAI SDK互換のインターフェースを提供。

無料

Caliper の代替AIツール

B

Basertによる個人のGitHub Pagesサイトで、現在はデフォルトのウェルカムコンテンツとJekyllを使ったGitHub Pagesの使用方法の説明を表示しています。

無料
DeepSQL logo

DeepSQLは、自己ホスト型エージェントを使用してワークロードを監視し、低速クエリを最適化し、データベースコストを削減するAI DBAです。MCPとSlack統合を備えています。

Panguard AI logo

AIエージェントのリアルタイムセキュリティ、スキル監査、ランタイム保護を実現するオープンソースプラットフォーム。コミュニティ駆動の脅威ルールを搭載。

OpenSEO logo

OpenSEOは、AIエージェントとMCPを介して統合し、キーワード調査、競合分析、被リンクなどのリアルなSEOデータを提供するオープンソースのSEOプラットフォームです。

SureWire Beta logo

SureWire Betaは、包括的なテストを通じてAIエージェントの安全性と信頼性を確保するAIエージェント検証プラットフォームです。

FlexInference logo

デッドライン対応型LLMルーターで、ユーザー指定の時間内に安価なサービス階層を自動的に見つけ、AI推論コストを削減します。

Shikigami logo

複数のAIコーディングエージェントを並行して、隔離されたgitワークツリー上で、完全なエディタと内蔵開発ツールを使用して実行します。

LoopGain logo

AIエージェントループ用のオープンソースのコストコントローラー。収束時にループを停止し、劣化前にロールバックします。