AI Udviklerværktøjer
Caliper
Open-source pålidelighedstestværktøj til AI-agentfærdigheder, der beregner pass@k-scorer på tværs af Claude Code, Codex og Pi-backends.
Caliper
Hvad er Caliper?
Caliper er et open-source CLI og en agentfærdighed, der måler pålideligheden af AI-agentfærdigheder ved at køre dem flere gange og beregne en pass@k-score med understøttelse af Claude Code, Codex, Pi og API-backends.
Caliper vs Lignende Værktøjer
| Prismodel | Gratis | Gratis | Tilpasset pris | Gratis, Betalt |
| Gratis credits | ||||
| Vigtige funktioner |
|
|
|
|
| Fordele |
|
|
|
|
| Ulemper |
|
|
|
|
| Bedst til |
|
|
|
|
Sådan bruger du Caliper?
- 1Installer via pipx: pipx install caliper-eval
- 2Skriv en .eval.yaml-spec med opgaver, prompter og forventede resultater
- 3Kør evalueringen: caliper run my-skill.eval.yaml --k 3 --baseline
- 4Eller brug agentfærdighederne: /evaluate-skill run my-skill.eval.yaml --k 3 --baseline
Caliper Vigtige funktioner
- pass@k-pålidelighedsscoring med konfigurerbar k
- Sammenligning med baseline uden færdigheden for at bevise delta
- LLM-dommer (expect:) og deterministiske Python-påstande (assert:)
- Understøttelse af flere backends: Claude Code, Codex, Pi, Claude API, OpenAI API
- Parallel udførelse af opgaver med konfigurerbare arbejdere
- Agentfærdigheder (evaluate-skill, grill-skill) til brug i arbejdsgangen
- Gemte resultater som JSON til historisk sporing
- Interaktiv spec-generering med grill-skill
Caliper Brugssituationer
- Valider at en færdighed faktisk forbedrer agentens ydeevne i forhold til baseline
- Spor pålidelighed på tværs af modelopdateringer og promptændringer
- Sammenlign hvilken agent-backend der kører en færdighed mere pålideligt
- Iterer på færdighedsprompter med målbar forbedring
Caliper Priser og gratis credits
Caliper bruger modellen Gratis.
Dette værktøj er helt gratis
Caliper Fordele og ulemper
Fordele
- Gentagelige, kvantitative pålidelighedsscorer
- Fungerer med flere agent-backends ud af boksen
- Adskiller færdighedsbidrag fra basisagent via baseline
- Understøtter både LLM-baseret og deterministisk bedømmelse
- Agentfærdigheder gør det muligt at køre evalueringer inde i Claude Code/Codex
Ulemper
- Kræver CLI-opsætning og agentspecifikke afhængigheder
- LLM-dommer kan være inkonsistent for subjektive opgaver
- Ingen indbygget testsuite til ikke-agent arbejdsgange
- Begrænset dokumentation for brugerdefinerede påstandshjælpere
Hvad er Caliper bedst til?
- Udviklere der bygger og vedligeholder agentfærdigheder
- Teams der har brug for at måle agentfærdighedspålidelighed på tværs af kørsler