KI Entwicklertools
Caliper
Open-Source-Zuverlässigkeitstest-Plattform für KI-Agentenfähigkeiten, die pass@k-Werte über Claude Code, Codex und Pi-Backends berechnet.
Caliper
Was ist Caliper?
Caliper ist ein Open-Source-CLI- und Agenten-Fähigkeit, die die Zuverlässigkeit von KI-Agentenfähigkeiten misst, indem sie diese mehrmals ausführt und einen pass@k-Wert berechnet, mit Unterstützung für Claude Code, Codex, Pi und API-Backends.
Caliper vs Ähnliche Tools
| Preismodell | Kostenlos | Kostenlos | Individuelle Preise | Kostenlos, Kostenpflichtig |
| Gratis-Credits | ||||
| Wichtige Funktionen |
|
|
|
|
| Vorteile |
|
|
|
|
| Nachteile |
|
|
|
|
| Geeignet für |
|
|
|
|
So nutzt du Caliper?
- 1Installation über pipx: pipx install caliper-eval
- 2Schreiben Sie eine .eval.yaml-Spezifikation mit Aufgaben, Prompts und erwarteten Ergebnissen
- 3Führen Sie die Evaluierung aus: caliper run my-skill.eval.yaml --k 3 --baseline
- 4Oder nutzen Sie die Agenten-Fähigkeiten: /evaluate-skill run my-skill.eval.yaml --k 3 --baseline
Caliper Wichtige Funktionen
- pass@k-Zuverlässigkeitsbewertung mit konfigurierbarem k
- Basislinienvergleich ohne die Fähigkeit, um den Delta-Effekt nachzuweisen
- LLM-Richter (expect:) und deterministische Python-Assertions (assert:)
- Unterstützung mehrerer Backends: Claude Code, Codex, Pi, Claude API, OpenAI API
- Parallele Aufgabenausführung mit konfigurierbaren Workern
- Agenten-Fähigkeiten (evaluate-skill, grill-skill) für die Nutzung innerhalb von Workflows
- Gespeicherte Ergebnisse als JSON für die historische Nachverfolgung
- Interaktive Spezifikationsgenerierung mit grill-skill
Caliper Anwendungsfälle
- Überprüfen, ob eine Fähigkeit die Agentenleistung tatsächlich im Vergleich zur Basislinie verbessert
- Zuverlässigkeit bei Modellaktualisierungen und Prompt-Änderungen verfolgen
- Vergleichen, welches Agenten-Backend eine Fähigkeit zuverlässiger ausführt
- Iterieren an Skill-Prompts mit messbarer Verbesserung
Caliper Preise und Gratis-Credits
Caliper arbeitet mit dem Modell Kostenlos.
Caliper Vorteile und Nachteile
Vorteile
- Wiederholbare, quantitative Zuverlässigkeitswerte
- Funktioniert sofort mit mehreren Agenten-Backends
- Trennt den Beitrag der Fähigkeit vom Basisagenten durch Basislinie
- Unterstützt sowohl LLM-basierte als auch deterministische Bewertung
- Agenten-Fähigkeiten ermöglichen die Durchführung von Evaluierungen innerhalb von Claude Code/Codex
Nachteile
- Erfordert CLI-Einrichtung und agentspezifische Abhängigkeiten
- LLM-Richter kann bei subjektiven Aufgaben inkonsistent sein
- Keine integrierte Testsuite für Nicht-Agenten-Workflows
- Begrenzte Dokumentation für benutzerdefinierte Assertion-Helfer
Wofür eignet sich Caliper am besten?
- Entwickler, die Agenten-Fähigkeiten erstellen und warten
- Teams, die die Zuverlässigkeit von Agenten-Fähigkeiten über mehrere Durchläufe messen müssen