AI 开发者工具

Caliper

开源的AI智能体技能可靠性测试工具,计算Claude Code、Codex和Pi后端的pass@k分数。

什么是 Caliper?

Caliper是一个开源CLI和智能体技能,通过多次运行并计算pass@k分数来评估AI智能体技能的可靠性,支持Claude Code、Codex、Pi和API后端。

Caliper 与相似工具比较

计价模式免费免费免费免费
免费额度
主要功能
  • 可配置k值的pass@k可靠性评分
  • 无技能基线比较以证明性能增量
  • LLM评判(expect:)和确定性Python断言(assert:)
  • 七个可破解盒子,涵盖OWASP智能体十大漏洞
  • 三个引导式模拟,涵盖级联故障、人机信任和恶意代理
  • 网络隔离的Docker容器,确保安全执行
  • 跨云、Git和Kubernetes的代码到运行时推理
  • 操作门为每个API调用强制执行只读策略
  • 沙盒化JavaScript执行以进行并发研究
  • 通过 Jaybase 实现仅追加、SHA-256 寻址的事件历史
  • 存储节点负载的 AES-256-GCM 加密
  • 用于分类账、笔记、快照和审计读取的统一 RBAC
优点
  • 可重复、定量的可靠性评分
  • 开箱即用支持多种智能体后端
  • 以真实的方式全面覆盖OWASP智能体十大
  • Docker隔离防止意外损坏
  • 构建时只读,防止意外写入
  • 基于证据的验证交叉检查每个发现
  • 有主见且安全的会计 CLI,带有不可变审计追踪
  • 专为 AI 代理集成设计,支持 JSON 输出
缺点
  • 需要CLI设置和特定智能体的依赖
  • LLM评判在主观任务上可能不一致
  • 需要Docker和技术设置
  • 不适用于生产环境;仅用于实验室环境
  • 需要LLM API密钥,产生令牌费用
  • 仅限于只读操作,无法进行修复
  • 预 1.0 版本,功能集有限
  • 没有原生 QuickBooks 导入功能(代理必须规范化数据)
适合对象
  • 构建和维护智能体技能的开发者
  • 需要跨运行衡量智能体技能可靠性的团队
  • 专注于AI智能体漏洞的安全研究员
  • 构建基于MCP的应用程序的开发者
  • 安全工程师
  • DevOps团队
  • 需要安全、可审计会计且支持 AI 代理的小型团队
  • 集成自动化记账工作流的开发者

如何使用 Caliper?

  1. 1通过pipx安装:pipx install caliper-eval
  2. 2编写.eval.yaml规范,包含任务、提示词和预期结果
  3. 3运行评估:caliper run my-skill.eval.yaml --k 3 --baseline
  4. 4或使用智能体技能:/evaluate-skill run my-skill.eval.yaml --k 3 --baseline

Caliper 主要功能

  • 可配置k值的pass@k可靠性评分
  • 无技能基线比较以证明性能增量
  • LLM评判(expect:)和确定性Python断言(assert:)
  • 多后端支持:Claude Code、Codex、Pi、Claude API、OpenAI API
  • 可配置工作进程的并行任务执行
  • 工作流内使用的智能体技能(evaluate-skill、grill-skill)
  • 结果为JSON格式,便于历史追踪
  • 使用grill-skill进行交互式规范生成

Caliper 使用场景

  • 验证技能是否确实提升了智能体相对于基线的性能
  • 追踪模型更新和提示词变化对可靠性的影响
  • 比较哪个智能体后端运行技能更可靠
  • 迭代技能提示词,实现可衡量的改进

Caliper 价格与免费额度

Caliper 目前采用 免费 模式。

此工具完全免费使用

开源

免费

MIT许可证,可在GitHub和PyPI上获取

Caliper 优缺点

优点

  • 可重复、定量的可靠性评分
  • 开箱即用支持多种智能体后端
  • 通过基线分离技能贡献与基础智能体
  • 同时支持基于LLM和确定性的评判
  • 智能体技能允许在Claude Code/Codex内运行评估

缺点

  • 需要CLI设置和特定智能体的依赖
  • LLM评判在主观任务上可能不一致
  • 没有针对非智能体工作流的内置测试套件
  • 自定义断言助手的文档有限

Caliper 最适合哪些用途?

  • 构建和维护智能体技能的开发者
  • 需要跨运行衡量智能体技能可靠性的团队

Caliper 常见问题

Caliper 的免费替代工具

Openbase logo

一个语音控制的IDE,让开发者能够通过语音启动Codex或Claude Code的AI编码会话,批准命令,并在手机上审查差异。

免费
SureWire logo

SureWire 是一个专门的 QA 平台,使用专用测试代理对 AI 代理进行压力测试,以确保其安全性、可靠性和合规性。

免费
Notte logo

为AI代理提供浏览器基础设施平台,使其通过云浏览器会话、代理和无服务器功能快速在互联网上运行。

免费
YAFL logo

一种以智能体为先的文件传输工具,通过MCP调用在AI智能体之间实现安全加密的文件共享,无需人类参与。

免费
Manifest logo

Manifest 将任意 URL 转换为 AI 代理可以在页面上交互的结构化 JSON 映射——按钮、表单、输入框和必填字段。

免费
B

Basert 的个人 GitHub Pages 网站,当前显示默认欢迎内容以及使用 GitHub Pages 和 Jekyll 的说明。

免费
Termaxa logo

一个供AI代理运行shell命令的协作门控,提供预览、备份、策略执行和审计,适用于Claude Code和Cursor等工具。

免费
Agentcard logo

Agentcard 为 AI 代理提供友好的发卡和支付基础设施,实现五分钟设置和自主购买。

免费

Caliper 的最佳替代 AI 工具

mcploitable logo

一组故意存在漏洞的MCP服务器,用于智能体安全培训,映射到OWASP智能体应用十大安全风险。

Cynative logo

开源AI工具,用于深度基础设施研究,跨代码、云和运行时运行前沿模型,提供经过验证的答案。

Magpie logo

Magpie 是一款专为人类和 AI 代理设计的、有主见的会计 CLI 工具,提供复式记账、RBAC 以及基于 Jaybase 的不可变事件存储。

agent-manager logo

终端用户界面,用于在 tmux 中管理 AI 编码代理会话(Claude Code、OpenCode、Codex、Grok Build),支持实时状态、分组树和差异审查。

Openbase logo

一个语音控制的IDE,让开发者能够通过语音启动Codex或Claude Code的AI编码会话,批准命令,并在手机上审查差异。

免费
OpsCat logo

零配置、单一二进制软件目录,具备自动发现、依赖可视化、合规评分卡以及对AI Agent的原生MCP集成。

BrowserAct Skills logo

面向AI代理的浏览器自动化CLI,用于绕过反机器人墙、移交人工处理以及并行运行任务。

lee-ai logo

一款AI驱动的购物助手,提供实时光标引导网站访客,指出产品并显示价格计算。