stars MIT zero deps

ia-engineer-framework

Framework open-source para hacer agentes IA fiables en produccion. 6 tiers progresivos: desde controlar tu agente en 10 minutos hasta CI/CD con evaluaciones automaticas.

Open-source framework for making AI agents reliable in production. 6 progressive tiers: from controlling your agent in 10 minutes to CI/CD with automated evaluations.

El problemaThe problem

Especificaciones vagasVague specifications
El agente solo puede adivinar lo que quieresThe agent can only guess what you want
Sin verificacionNo verification
Dice "listo" sin ejecutar testsSays "done" without running tests
Sin estadoNo state
Cada sesion empieza de ceroEvery session starts from scratch
Sin observabilidadNo observability
No sabes cuanto cuesta ni si la calidad bajaYou don't know the cost or if quality drops
Sin CI/CDNo CI/CD
Cambios del agente llegan a produccion sin verificarAgent changes reach production unverified
Convenciones no escritasUnwritten conventions
El agente no puede cumplir lo que no conoceThe agent can't follow what it doesn't know

6 tiers progresivos6 progressive tiers

1

Harness

CLAUDE.md, AGENTS.md, init.sh, feature_list.json, progress.md, session-handoff.md

10 min
2

Eval

4 datasets JSONL (32 escenarios), run-evals.py, score-evals.py, ci-gate.py, rubrica 6 dimensiones

4 JSONL datasets (32 scenarios), run-evals.py, score-evals.py, ci-gate.py, 6-dimension rubric

30 min
3

Observe

Logger 10 campos, cost tracker, dashboard Grafana, guia PostHog, alertas presupuesto y drift

10-field logger, cost tracker, Grafana dashboard, PostHog guide, budget and drift alerts

1h
4

Hooks

Pre-commit lint, post-task verify, context check, cost guard ($10/session), security scan

15 min
5

Patterns

Diagnostic loop, multi-session, graph engineering, circuit breaker, HITL, model routing, prompt versioning, agent testing

lecturareading
6

CI/CD

GitHub Action para evals en PR, quality gate, pre-push check

GitHub Action for PR evals, quality gate, pre-push check

1h

Empieza en 5 minutosGet started in 5 minutes

git clone https://github.com/pedri77/ia-engineer-framework.git

cp -r ia-engineer-framework/harness/ your-project/

nano your-project/CLAUDE.md
nano your-project/feature_list.json

# Run your AI agent

ComparativaComparison

Learn Harness Eng (11.3K stars)ia-engineer-framework
ScopeSolo harnessHarness onlyHarness + eval + observe + CI + patterns
Eval pipelineNoRunner + scorer + CI gate
ObservabilidadObservabilityNoLogger + cost tracker + alerts
CI/CDNoGitHub Action + quality gate
IdiomaLanguageInglesEnglishEspanol nativoSpanish native
FormatoFormatCursoCourseCopy-paste to production
Lock-inEspecificoSpecificClaude Code, Codex, Cursor

PrincipiosPrinciples

Automatizacion > IAAutomation > AISi un test lo resuelve, no uses LLMIf a test solves it, don't use an LLM
Verificable > inteligenteVerifiable > smart8 evals > 1 prompt perfecto8 evals > 1 perfect prompt
Copy-pasteCada archivo funciona standaloneEvery file works standalone
ProgresivoProgressiveTier 1 en 10 min, Tier 6 con equipoTier 1 in 10 min, Tier 6 with a team
MedibleMeasurableSi no mides, no implementesIf you can't measure it, don't ship it
Sin lock-inCualquier agente IAAny AI agent