ИИ Инструменты разработчика
Caliper
Открытый инструмент для тестирования надежности навыков AI-агентов, вычисляющий показатели pass@k для бэкендов Claude Code, Codex и Pi.
Caliper
Что такое Caliper?
Caliper — это CLI-инструмент и навык агента с открытым исходным кодом, который измеряет надежность навыков AI-агентов, запуская их несколько раз и вычисляя показатель pass@k. Поддерживает бэкенды Claude Code, Codex, Pi и API.
Caliper — сравнение с аналогами
| Модель ценообразования | Бесплатно | Бесплатно | Индивидуальная цена | Бесплатно, Платно |
| Бесплатные кредиты | ||||
| Ключевые возможности |
|
|
|
|
| Плюсы |
|
|
|
|
| Минусы |
|
|
|
|
| Кому подходит |
|
|
|
|
Как использовать Caliper?
- 1Установите через pipx: pipx install caliper-eval
- 2Напишите spec-файл .eval.yaml с задачами, промптами и ожидаемыми результатами
- 3Запустите оценку: caliper run my-skill.eval.yaml --k 3 --baseline
- 4Или используйте навыки агента: /evaluate-skill run my-skill.eval.yaml --k 3 --baseline
Caliper Ключевые возможности
- Оценка надежности pass@k с настраиваемым k
- Сравнение с базовым уровнем без навыка для демонстрации прироста
- LLM-судья (expect:) и детерминированные проверки на Python (assert:)
- Поддержка нескольких бэкендов: Claude Code, Codex, Pi, Claude API, OpenAI API
- Параллельное выполнение задач с настраиваемым числом рабочих процессов
- Навыки агента (evaluate-skill, grill-skill) для использования внутри рабочего процесса
- Сохранение результатов в формате JSON для исторического отслеживания
- Интерактивная генерация спецификаций с помощью grill-skill
Caliper Сценарии использования
- Проверка, что навык действительно улучшает производительность агента по сравнению с базовым уровнем
- Отслеживание надежности при обновлениях модели и изменениях промптов
- Сравнение, какой бэкенд агента запускает навык более надежно
- Итеративное улучшение промптов навыка с измеримым прогрессом
Caliper Цены и бесплатный доступ
Модель оплаты Caliper: Бесплатно.
Caliper Плюсы и минусы
Плюсы
- Повторяемые количественные показатели надежности
- Работает с несколькими бэкендами агентов из коробки
- Отделяет вклад навыка от базового агента с помощью базового уровня
- Поддерживает как LLM-основанную, так и детерминированную оценку
- Навыки агента позволяют запускать оценки внутри Claude Code/Codex
Минусы
- Требуется настройка CLI и зависимости, специфичные для агентов
- LLM-судья может быть непоследовательным для субъективных задач
- Нет встроенного набора тестов для неагентских рабочих процессов
- Ограниченная документация по пользовательским вспомогательным функциям
Для чего лучше всего подходит Caliper?
- Разработчики, создающие и поддерживающие навыки агентов
- Команды, которым необходимо измерять надежность навыков агентов в разных запусках