claudegoodies
Skill

eval-harness

From affaan-m

Framework formal de evaluación para sesiones de Claude Code que implementa principios de desarrollo orientado a evals (EDD)

Defines a markdown/bash workflow for writing eval definitions, evaluators, and pass@k reports before and after coding tasks.

Use it when

  • Setting up eval-driven development conventions for a Claude Code project
  • Defining pass/fail criteria for a feature before implementation
  • Tracking regression tests across prompt or model changes
  • Comparing agent reliability across model versions with pass@k metrics

Skip it if

  • Just markdown templates and conventions, not an automated eval runner
  • No actual /eval command implementation, only documented workflow patterns
  • Requires manually writing and maintaining eval files under .claude/evals/

Facts

Repository
affaan-m/ECC
Status
Actively maintained
Last commit
Declared tools
Read, Write, Edit, Bash, Grep, Glob

Source preview

The instructions Claude Code reads when this skill runs.

# Skill Eval Harness

Un framework formal de evaluación para sesiones de Claude Code, implementando principios de desarrollo orientado a evals (EDD).

## Cuándo Activar

- Configurar desarrollo orientado a evals (EDD) para flujos de trabajo asistidos por IA
- Definir criterios de pass/fail para la completitud de tareas en Claude Code
- Medir confiabilidad del agente con métricas pass@k
- Crear suites de pruebas de regresión para cambios de prompts o agentes
- Comparar rendimiento del agente entre versiones de modelos

## Filosofía

El Desarrollo Orientado a Evals trata los evals como las "pruebas unitarias del desarrollo de IA":
- Definir el comportamiento esperado ANTES de la implementación
- Ejecutar evals continuamente durante el desarrollo
- Rastrear regresiones con cada cambio
- Usar métricas pass@k para medición de confiabilidad

## Tipos de Eval

### Evals de Capacidad
Probar si Claude puede hacer algo que antes no podía:
```markdown
[CAPABILITY EVAL: feature-name]
Task: Descripción de lo que Claude debe lograr
Success Criteria:
  - [ ] Criterio 1
  - [ ] Criterio 2
  - [ ] Criterio 3
Expected Output: Descripción del resultado esperado
```

### Evals de Regresión
Asegurar que los cambios no rompan la funcionalidad existente:
```markdown
[REGRESSION EVAL: feature-name]
Baseline: SHA o nombre del checkpoint
Tests:
  - existing-test-1: PASS/FAIL
  - existing-test-2: PASS/FA
View full source on GitHub →

Other skills