agent-workflowsПроверки: пройдено 5

eval-harness

Формальный фреймворк для оценки сессий Claude Code, поддерживающий принципы eval‑driven development (EDD).

Что это за skill и зачем он нужен

Eval Harness предоставляет набор методик и шаблонов для организации eval‑driven development в проектах, использующих Claude Code. С помощью него можно заранее определить критерии успеха, автоматически запускать capability‑ и regression‑evals, измерять надёжность агентов метриками pass@k и pass^k, а также формировать отчёты. Фреймворк поддерживает три типа грейдеров (code‑based, model‑based, human) и интегрируется в рабочий процесс через команды /eval define, /eval check и /eval report, сохраняя все определения в каталоге .claude/evals.

Как установить

npx skills add https://github.com/affaan-m/everything-claude-code --skill eval-harness

Когда использовать

Подходит

  • Настройка eval‑driven development (EDD) для AI‑ассистированных рабочих процессов
  • Определение критериев pass/fail для задач Claude Code
  • Измерение надёжности агента с помощью метрик pass@k и pass^k
  • Создание регрессионных тест‑сьютов при изменении промптов или кода агента
  • Бенчмаркинг производительности агента между версиями моделей
  • Автоматизация отчётности об оценках в CI/CD

Не подходит

  • Проекты, не использующие Claude Code или аналогичные модели
  • Ситуации, где требуется исключительно ручная проверка без автоматизации
  • Краткосрочные прототипы, где формальные eval‑ы избыточны
  • Отсутствие возможности хранить файлы в .claude/evals
  • Код с критически высоким уровнем риска без обязательного human review
  • Когда необходимы только традиционные unit‑тесты без AI‑ориентированных оценок

Проверки безопасности

Gen Agent Trust HubПройдено

Проверка не нашла критичных проблем.

RunlayerПройдено

Проверен 1 файл · проблем не найдено.

SnykПройдено

Низкий риск · проблем не найдено.

SocketПройдено

Предупреждений нет.

ZeroLeaksПройдено

Оценка 93/100 · проанализировано 2 раздела.

Похожие skills