Técnicas, plantillas de código y directrices para pipelines LLM en producción. Adaptado a los casos de uso reales de los clientes de CULTIVA IA.
Plantillas listas para producción, con casos de uso reales de clientes CULTIVA IA
Sin ejemplos. El modelo clasifica directamente apoyándose en su preentrenamiento. Óptimo para tareas claras donde el formato de salida es simple y el dominio es común.
Incluye 3–5 ejemplos representativos antes del input real. Mejora la consistencia del formato y calibra el modelo al dominio específico.
El modelo razona paso a paso antes de dar la respuesta final. Imprescindible para análisis legal, financiero o lógico multi-paso donde importa el proceso, no solo el resultado.
El agente alterna razonamiento (Thought) con llamadas a herramientas (Action) y observación de resultados (Observation). Base de todos los agentes con herramientas.
Claude interpreta XML de forma nativa. Separar task, format y document con etiquetas reduce ambigüedad y mejora la precisión en extracciones estructuradas.
Usa el LLM para generar o mejorar prompts de otros LLMs. Ideal cuando el prompt necesita adaptarse a contextos variables sin intervención manual continua.
Genera N respuestas independientes con temperatura >0 y selecciona la mayoritaria. Mejora la fiabilidad en tareas de razonamiento donde hay incertidumbre.
Optimizaciones específicas para cada proveedor LLM
response_format: {type: "json_object"}responseMimeType: "application/json"Resultados de las últimas pruebas en clientes CULTIVA IA
Reglas aplicadas en todos los proyectos CULTIVA IA
| Regla | Qué hacer | Por qué |
|---|---|---|
✓Empieza simple |
Zero-shot primero. Añade complejidad solo si el error >10% | Cada nivel extra añade latencia y coste de tokens |
✓Formato explícito |
Muestra un ejemplo JSON si quieres JSON; no asumas | Elimina la ambigüedad y reduce post-procesado |
✓System vs User |
System: persona y restricciones. User: la tarea concreta | Cada modelo interpreta este split de forma diferente |
✓Versiona los prompts |
Guarda prompts en git con semver (v1.2.0) y métricas | Los modelos cambian; el historial evita regresiones |
⚠Prueba adversarialmente |
Inputs vacíos, contradictorios, en idiomas inesperados | Los casos extremos aparecen en producción, no en demos |
⚠Coste vs precisión |
Self-consistency: solo si el margen de error es crítico | 7x llamadas = 7x coste. Medir antes de decidir |
✓Campo no encontrado |
En extracción, especifica qué devolver si el campo falta (null, "N/A") | Sin instrucción, el modelo inventa valores (alucinación) |
✗No mezcles tareas |
Un prompt = una tarea. No "extrae Y luego clasifica Y luego resume" | La precisión baja cuando hay múltiples objetivos en conflicto |