Alat Pengembang AI
Caliper
Alat uji keandalan sumber terbuka untuk keterampilan agen AI, menghitung skor pass@k di berbagai backend Claude Code, Codex, dan Pi.
Caliper
Apa itu Caliper?
Caliper adalah CLI dan keterampilan agen sumber terbuka yang mengukur keandalan keterampilan agen AI dengan menjalankannya beberapa kali dan menghitung skor pass@k, dengan dukungan untuk backend Claude Code, Codex, Pi, dan API.
Caliper vs Alat Serupa
| Model Harga | Gratis | Gratis | Harga khusus | Gratis, Berbayar |
| Kredit Gratis | ||||
| Fitur utama |
|
|
|
|
| Kelebihan |
|
|
|
|
| Kekurangan |
|
|
|
|
| Cocok untuk |
|
|
|
|
Cara menggunakan Caliper?
- 1Instal melalui pipx: pipx install caliper-eval
- 2Tulis spesifikasi .eval.yaml dengan tugas, prompt, dan hasil yang diharapkan
- 3Jalankan evaluasi: caliper run my-skill.eval.yaml --k 3 --baseline
- 4Atau gunakan keterampilan agen: /evaluate-skill run my-skill.eval.yaml --k 3 --baseline
Caliper Fitur utama
- Skor keandalan pass@k dengan k yang dapat dikonfigurasi
- Perbandingan dasar tanpa keterampilan untuk membuktikan delta
- Hakim LLM (expect:) dan asersi Python deterministik (assert:)
- Dukungan berbagai backend: Claude Code, Codex, Pi, Claude API, OpenAI API
- Eksekusi tugas paralel dengan pekerja yang dapat dikonfigurasi
- Keterampilan agen (evaluate-skill, grill-skill) untuk penggunaan dalam alur kerja
- Hasil disimpan sebagai JSON untuk pelacakan historis
- Pembuatan spesifikasi interaktif dengan grill-skill
Caliper Contoh penggunaan
- Memvalidasi bahwa suatu keterampilan benar-benar meningkatkan kinerja agen dibandingkan baseline
- Melacak keandalan di seluruh pembaruan model dan perubahan prompt
- Membandingkan backend agen mana yang menjalankan keterampilan dengan lebih andal
- Mengulangi prompt keterampilan dengan peningkatan yang terukur
Caliper Harga dan kredit gratis
Caliper menggunakan model Gratis.
Alat ini sepenuhnya gratis
Caliper Kelebihan dan kekurangan
Kelebihan
- Skor keandalan kuantitatif yang dapat diulang
- Berfungsi dengan berbagai backend agen langsung tanpa pengaturan
- Memisahkan kontribusi keterampilan dari agen dasar melalui baseline
- Mendukung penilaian berbasis LLM dan deterministik
- Keterampilan agen memungkinkan menjalankan evaluasi di dalam Claude Code/Codex
Kekurangan
- Memerlukan pengaturan CLI dan dependensi khusus agen
- Hakim LLM mungkin tidak konsisten untuk tugas subjektif
- Tidak ada rangkaian tes bawaan untuk alur kerja non-agen
- Dokumentasi terbatas untuk pembantu asersi kustom
Caliper paling cocok untuk apa?
- Pengembang yang membangun dan memelihara keterampilan agen
- Tim yang perlu mengukur keandalan keterampilan agen di berbagai eksekusi