Pipeline SFT → DPO → Reward Model · Modelo juridico espanol B2B
sft_lexai.yaml — Fase 1
dpo_lexai.yaml — Fase 2
Paso 1 — SFT con LoRA
Paso 2 — DPO
Paso 3 — Reward Model
| Fase | Tecnica | Duracion est. | Memoria GPU | Coste AWS spot | KPI esperado | Estado |
|---|---|---|---|---|---|---|
| Fase 1 | SFT + LoRA | ~3 h | ~48 GB (2×24) | ~85 € | Loss < 1.2 | Planificado |
| Fase 2 | DPO | ~2 h | ~56 GB (2×28) | ~60 € | Win-rate > 65 % | Planificado |
| Fase 3 | Reward Model | ~1.5 h | ~36 GB (2×18) | ~45 € | AUC > 0.84 | Planificado |
| Eval final | Benchmark LexAI | ~30 min | ~20 GB (1 GPU) | ~12 € | Precision@1 ≥ 78 % | Pendiente |
--per_device_train_batch_size a 2 y aumentar --gradient_accumulation_steps a 8.
Activar --gradient_checkpointing. Cambiar a ZeRO-3 si persiste.
prompt y completion para SFT, y columnas
prompt, chosen, rejected para DPO/Reward.
--packing true para secuencias cortas. Usar --bf16 en A100.
Verificar que --accelerate_config zero2 esta activo para distribucin optima.
bitsandbytes GPTQ o AutoGPTQ.
Servir con vLLM --quantization gptq. Merging LoRA antes de exportar.