AI Utviklerverktøy
Caliper
Åpen kildekode-testverktøy for pålitelighet for AI-agentferdigheter, som beregner pass@k-skårer på tvers av Claude Code, Codex og Pi-bakender.
Caliper
Hva er Caliper?
Caliper er et åpen kildekode CLI- og agentferdighet som måler påliteligheten til AI-agentferdigheter ved å kjøre dem flere ganger og beregne en pass@k-skår, med støtte for Claude Code, Codex, Pi og API-bakender.
Caliper vs Lignende Verktøy
| Prismodell | Gratis | Gratis | Tilpasset prising | Gratis, Betalt |
| Gratis kreditter | ||||
| Viktige funksjoner |
|
|
|
|
| Fordeler |
|
|
|
|
| Ulemper |
|
|
|
|
| Passer best for |
|
|
|
|
Slik bruker du Caliper?
- 1Installer via pipx: pipx install caliper-eval
- 2Skriv en .eval.yaml-spesifikasjon med oppgaver, ledetekster og forventede resultater
- 3Kjør evalueringen: caliper run my-skill.eval.yaml --k 3 --baseline
- 4Eller bruk agentferdighetene: /evaluate-skill run my-skill.eval.yaml --k 3 --baseline
Caliper Viktige funksjoner
- pass@k pålitelighetsskår med konfigurerbar k
- Grunnlinjesammenligning uten ferdigheten for å bevise delta
- LLM-dommer (expect:) og deterministiske Python-assertions (assert:)
- Støtte for flere bakender: Claude Code, Codex, Pi, Claude API, OpenAI API
- Parallell oppgavekjøring med konfigurerbare arbeidere
- Agentferdigheter (evaluate-skill, grill-skill) for bruk i arbeidsflyt
- Lagrede resultater som JSON for historisk sporing
- Interaktiv spesifikasjonsgenerering med grill-skill
Caliper Bruksområder
- Bekreft at en ferdighet faktisk forbedrer agentytelse over grunnlinjen
- Spor pålitelighet på tvers av modelloppdateringer og endringer i ledetekster
- Sammenlign hvilken agentbakende som kjører en ferdighet mer pålitelig
- Iterer på ferdighetsledetekster med målbare forbedringer
Caliper Priser og gratiskreditter
Caliper bruker prismodellen Gratis.
Dette verktøyet er helt gratis
Caliper Fordeler og ulemper
Fordeler
- Gjentagbare, kvantitative pålitelighetsskår
- Fungerer med flere agentbakender rett ut av boksen
- Separer ferdighetsbidrag fra basisagent via grunnlinje
- Støtter både LLM-basert og deterministisk bedømming
- Agentferdigheter tillater å kjøre evalueringer inne i Claude Code/Codex
Ulemper
- Krever CLI-oppsett og agentspesifikke avhengigheter
- LLM-dommer kan være inkonsekvent for subjektive oppgaver
- Ingen innebygd testpakke for ikke-agentarbeidsflyter
- Begrenset dokumentasjon for tilpassede assertions-hjelpere
Hva passer Caliper best til?
- Utviklere som bygger og vedlikeholder agentferdigheter
- Team som trenger å måle pålitelighet for agentferdigheter på tvers av kjøringer