$
/ar:setup
?
¿Dominio del experimento?
(engineering, marketing, content, prompts, custom)
›
marketing
?
¿Nombre del experimento?
(ej. api-speed, blog-titles)
›
email-subjects
?
¿Archivo objetivo a optimizar?
›
src/email_subject_agent.py
✓
Archivo verificado — 347 lineas, 12.4 KB
?
¿Comando de evaluacion?
(ej. pytest bench.py, python evaluate.py)
›
python evaluate_subjects.py --sample 50
?
¿Metrica que devuelve el evaluador?
(ej. p50_ms, ctr_score, pass_rate)
›
engagement_score
?
¿Es mejor un valor mas alto o mas bajo?
›
higher
?
¿Usar evaluador interno o el tuyo?
(llm_judge_copy recomendado para copy/email)
›
llm_judge_copy
built-in
?
¿Almacenar en proyecto o global?
›
project
→ .autoresearch/
✓
Directorio creado:
.autoresearch/marketing/email-subjects/
✓
Configuracion guardada:
experiment.json
✓
Rama git creada:
ar/marketing/email-subjects
✓
Copia baseline de:
src/email_subject_agent.py
→ .autoresearch/marketing/email-subjects/baseline.py
$
python evaluate_subjects.py --sample 50
output del evaluador:
{"engagement_score": 18.4, "samples": 50, "model": "gpt-4o-mini",
"breakdown": {"urgency": 14.2, "clarity": 22.1, "emotion": 18.9}}
✓
Metrica baseline registrada:
engagement_score = 18.4
(escala 0-100, objetivo: >= 28)