Yapay Zeka Geliştirici Araçları
Caliper
Yapay zeka ajan becerileri için açık kaynaklı güvenilirlik test koşum takımı; Claude Code, Codex ve Pi arka uçlarında pass@k puanlarını hesaplar.
Caliper
Nedir Caliper?
Caliper, açık kaynaklı bir CLI ve ajan becerisidir; yapay zeka ajan becerilerinin güvenilirliğini birden çok kez çalıştırarak ve bir pass@k puanı hesaplayarak ölçer; Claude Code, Codex, Pi ve API arka uçlarını destekler.
Caliper vs Benzer Araçlar
| Fiyatlandırma Modeli | Ücretsiz | Ücretsiz | Özel fiyatlandırma | Ücretsiz, Ücretli |
| Ücretsiz Krediler | ||||
| Temel özellikler |
|
|
|
|
| Artılar |
|
|
|
|
| Eksiler |
|
|
|
|
| Kimler için uygun |
|
|
|
|
Nasıl kullanılır Caliper?
- 1pipx ile kurun: pipx install caliper-eval
- 2Görevler, komutlar ve beklenen sonuçları içeren bir .eval.yaml şartnamesi yazın
- 3Değerlendirmeyi çalıştırın: caliper run my-skill.eval.yaml --k 3 --baseline
- 4Veya ajan becerilerini kullanın: /evaluate-skill run my-skill.eval.yaml --k 3 --baseline
Caliper Temel özellikler
- Yapılandırılabilir k ile pass@k güvenilirlik puanlaması
- Delta kanıtlamak için beceri olmadan temel karşılaştırma
- LLM yargıcı (expect:) ve deterministik Python iddiaları (assert:)
- Çoklu arka uç desteği: Claude Code, Codex, Pi, Claude API, OpenAI API
- Yapılandırılabilir işçilerle paralel görev yürütme
- İş akışı içi kullanım için ajan becerileri (evaluate-skill, grill-skill)
- Geçmiş takibi için JSON olarak kaydedilmiş sonuçlar
- grill-skill ile etkileşimli şartname oluşturma
Caliper Kullanım senaryoları
- Bir becerinin ajan performansını temel çizgiye göre gerçekten iyileştirdiğini doğrulama
- Model güncellemeleri ve komut değişikliklerinde güvenilirliği izleme
- Hangi ajan arka ucunun bir beceriyi daha güvenilir çalıştırdığını karşılaştırma
- Ölçülebilir iyileştirme ile beceri komutlarını yineleme
Caliper Fiyatlar ve ücretsiz krediler
Caliper, Ücretsiz modeliyle çalışır.
Caliper Artılar ve eksiler
Artılar
- Tekrarlanabilir, nicel güvenilirlik puanları
- Kutudan çıktığı gibi birden çok ajan arka ucuyla çalışır
- Temel çizgi aracılığıyla beceri katkısını temel ajandan ayırır
- Hem LLM tabanlı hem de deterministik yargılamayı destekler
- Ajan becerileri, Claude Code/Codex içinde değerlendirme çalıştırmaya olanak tanır
Eksiler
- CLI kurulumu ve ajana özel bağımlılıklar gerektirir
- LLM yargıcı, öznel görevler için tutarsız olabilir
- Ajan olmayan iş akışları için yerleşik test paketi yok
- Özel iddia yardımcıları için sınırlı dokümantasyon
Caliper en çok ne için uygundur?
- Ajan becerileri geliştiren ve bakımını yapan geliştiriciler
- Çalıştırmalar arasında ajan becerisi güvenilirliğini ölçmesi gereken ekipler