eval-harness
Формальный фреймворк для оценки сессий Claude Code, поддерживающий принципы eval‑driven development (EDD).
Суть
Что это за skill и зачем он нужен
Eval Harness предоставляет набор методик и шаблонов для организации eval‑driven development в проектах, использующих Claude Code. С помощью него можно заранее определить критерии успеха, автоматически запускать capability‑ и regression‑evals, измерять надёжность агентов метриками pass@k и pass^k, а также формировать отчёты. Фреймворк поддерживает три типа грейдеров (code‑based, model‑based, human) и интегрируется в рабочий процесс через команды /eval define, /eval check и /eval report, сохраняя все определения в каталоге .claude/evals.
Установка
Как установить
npx skills add https://github.com/affaan-m/everything-claude-code --skill eval-harnessСценарии
Когда использовать
Подходит
- Настройка eval‑driven development (EDD) для AI‑ассистированных рабочих процессов
- Определение критериев pass/fail для задач Claude Code
- Измерение надёжности агента с помощью метрик pass@k и pass^k
- Создание регрессионных тест‑сьютов при изменении промптов или кода агента
- Бенчмаркинг производительности агента между версиями моделей
- Автоматизация отчётности об оценках в CI/CD
Не подходит
- Проекты, не использующие Claude Code или аналогичные модели
- Ситуации, где требуется исключительно ручная проверка без автоматизации
- Краткосрочные прототипы, где формальные eval‑ы избыточны
- Отсутствие возможности хранить файлы в .claude/evals
- Код с критически высоким уровнем риска без обязательного human review
- Когда необходимы только традиционные unit‑тесты без AI‑ориентированных оценок
Доверие
Проверки безопасности
Проверка не нашла критичных проблем.
Проверен 1 файл · проблем не найдено.
Низкий риск · проблем не найдено.
Предупреждений нет.
Оценка 93/100 · проанализировано 2 раздела.
Похожие