AI 개발자 도구
Caliper
AI 에이전트 스킬을 위한 오픈소스 신뢰성 테스트 도구로, Claude Code, Codex, Pi 백엔드에서 pass@k 점수를 계산합니다.
Caliper
Caliper란?
Caliper는 AI 에이전트 스킬의 신뢰성을 측정하는 오픈소스 CLI 및 에이전트 스킬입니다. 여러 번 실행하여 pass@k 점수를 계산하며, Claude Code, Codex, Pi 및 API 백엔드를 지원합니다.
Caliper vs 유사 도구
| 가격 모델 | 무료 | 무료 | 맞춤형 요금제 | 무료, 유료 |
| 무료 크레딧 | ||||
| 주요 기능 |
|
|
|
|
| 장점 |
|
|
|
|
| 단점 |
|
|
|
|
| 추천 대상 |
|
|
|
|
Caliper 사용 방법
- 1pipx로 설치: pipx install caliper-eval
- 2작업, 프롬프트 및 예상 결과가 포함된 .eval.yaml 사양을 작성
- 3평가 실행: caliper run my-skill.eval.yaml --k 3 --baseline
- 4또는 에이전트 스킬 사용: /evaluate-skill run my-skill.eval.yaml --k 3 --baseline
Caliper 주요 기능
- 구성 가능한 k를 사용한 pass@k 신뢰성 점수
- 스킬 없이 베이스라인 비교로 델타 증명
- LLM 평가자(expect:) 및 결정론적 Python 어설션(assert:)
- 다중 백엔드 지원: Claude Code, Codex, Pi, Claude API, OpenAI API
- 구성 가능한 작업자로 병렬 작업 실행
- 워크플로우 내 사용을 위한 에이전트 스킬(evaluate-skill, grill-skill)
- 이력 추적을 위한 JSON 결과 저장
- grill-skill을 사용한 대화형 사양 생성
Caliper 사용 사례
- 스킬이 실제로 베이스라인 대비 에이전트 성능을 향상시키는지 확인
- 모델 업데이트 및 프롬프트 변경에 따른 신뢰성 추적
- 어느 에이전트 백엔드가 스킬을 더 안정적으로 실행하는지 비교
- 측정 가능한 개선으로 스킬 프롬프트 반복 개선
Caliper 가격 및 무료 크레딧
Caliper의 가격 모델은 무료입니다.
Caliper 장점과 단점
장점
- 반복 가능한 정량적 신뢰성 점수
- 여러 에이전트 백엔드와 즉시 작동
- 베이스라인을 통해 기본 에이전트와 스킬 기여도 분리
- LLM 기반 및 결정론적 판단 모두 지원
- 에이전트 스킬로 Claude Code/Codex 내에서 평가 실행 가능
단점
- CLI 설정 및 에이전트별 종속성 필요
- LLM 평가자는 주관적 작업에 대해 일관성이 부족할 수 있음
- 비에이전트 워크플로우를 위한 내장 테스트 스위트 없음
- 사용자 정의 어설션 도우미에 대한 문서 부족
Caliper은 어떤 용도에 가장 적합한가요?
- 에이전트 스킬을 구축 및 유지보수하는 개발자
- 실행 간 에이전트 스킬 신뢰성 측정이 필요한 팀