claude-code — /ar:setup (modo interactivo)
$ /ar:setup
# Iniciando asistente de configuracion de experimento...
? ¿Dominio del experimento? (engineering, marketing, content, prompts, custom)
marketing
? ¿Nombre del experimento? (ej. api-speed, blog-titles)
email-subjects
? ¿Archivo objetivo a optimizar?
src/email_subject_agent.py
Archivo verificado — 347 lineas, 12.4 KB
? ¿Comando de evaluacion? (ej. pytest bench.py, python evaluate.py)
python evaluate_subjects.py --sample 50
? ¿Metrica que devuelve el evaluador? (ej. p50_ms, ctr_score, pass_rate)
engagement_score
? ¿Es mejor un valor mas alto o mas bajo?
higher
? ¿Usar evaluador interno o el tuyo? (llm_judge_copy recomendado para copy/email)
llm_judge_copy built-in
? ¿Almacenar en proyecto o global?
project → .autoresearch/
# Ejecutando setup_experiment.py...
Directorio creado: .autoresearch/marketing/email-subjects/
Configuracion guardada: experiment.json
Rama git creada: ar/marketing/email-subjects
Copia baseline de: src/email_subject_agent.py → .autoresearch/marketing/email-subjects/baseline.py
# Verificando comando de evaluacion en baseline...
$ python evaluate_subjects.py --sample 50
output del evaluador:
{"engagement_score": 18.4, "samples": 50, "model": "gpt-4o-mini",
"breakdown": {"urgency": 14.2, "clarity": 22.1, "emotion": 18.9}}
Metrica baseline registrada: engagement_score = 18.4 (escala 0-100, objetivo: >= 28)
Experimento
marketing / email-subjects
Rama: ar/marketing/email-subjects
Archivo objetivo
src/email_subject_agent.py
347 lineas · 12.4 KB · Python
Metrica objetivo
engagement_score ↑
Baseline: 18.4 → Target: ≥ 28.0
Evaluador
llm_judge_copy
python evaluate_subjects.py --sample 50
Proyeccion de mejora — engagement_score (higher is better)
Baseline
18.4
Iter. 3
22.1
Iter. 6
26.3
Iter. 10 ✓
31.8
Target
28.0
Mejora proyectada: +72.8% sobre baseline Iteraciones estimadas: ~10 Modelo: gpt-4o-mini (llm_judge_copy)
Evaluadores disponibles — /ar:setup --list-evaluators
Evaluador Metrica Mejor Caso de uso Estado
benchmark_speed p50_ms lower Tiempo de ejecucion de funciones/API ✓ listo
benchmark_size size_bytes lower Tamano de archivo / bundle / imagen Docker ✓ listo
test_pass_rate pass_rate higher Porcentaje de tests que pasan ✓ listo
build_speed build_seconds lower Tiempo de compilacion / build Docker ✓ listo
memory_usage peak_mb lower Pico de memoria durante ejecucion ✓ listo
llm_judge_content ctr_score higher Titulares, titulos de blog, descripciones ✓ listo
llm_judge_copy engagement_score higher Posts sociales, copy de ads, asuntos de email EN USO
llm_judge_prompt quality_score higher System prompts, instrucciones de agentes ✓ listo
Proximos pasos sugeridos
/ar:run marketing/email-subjects
Ejecutar una iteracion manual
/ar:loop marketing/email-subjects
Modo autonomo hasta alcanzar objetivo
/ar:setup --list
Ver todos los experimentos activos
.autoresearch/marketing/email-subjects/experiment.json