CULTIVA IA · IA-Ingeniería-MLOps · Skill: buscador-mejores-modelos-huggingface
Comparativa de Modelos para RAG Legal + Extracción de Entidades
Cliente: Cultiva Legal AI (SaaS B2B)
Tarea: RAG sobre documentos legales + extracción de entidades
Fecha: 18 Jun 2026
Leaderboards consultados: 5
Modelos evaluados: 14
Hardware y presupuesto de parámetros
🖥
Servidor producción — NVIDIA A10G (24 GB VRAM)
AWS EC2 g5.xlarge · vLLM / transformers
fp16 máx
12B
Q4 máx
48B
💻
Desarrollo local — MacBook Pro M2 Pro (16 GB unificada)
llama.cpp / ollama · inferencia local
fp16 máx
8B
Q4 máx
32B
Leaderboards y benchmarks consultados
open-llm-leaderboard/results
MTEB (Retrieval)
LegalBench
MMLU-Law
LexGLUE (limitado)
✗ legal-ie-leaderboard (404)
Tabla comparativa de modelos
# Modelo Params MTEB Retrieval LegalBench MMLU-Law Licencia Servidor (A10G) Local (M2 Pro)
mistralai · Context: 32k tokens
7.2B
67.4%
71.8%
74.2%
Apache 2.0 ✓ fp16 ✓ fp16
2
Qwen · Context: 128k tokens
14.7B
68.9%
73.5%
77.1%
Apache 2.0 Q4 only necesita quantización Q4 only ~10 GB Q4_K_M
3
meta-llama · Context: 128k tokens
8.0B
65.1%
68.3%
72.9%
Llama 3.1 ✓ fp16 Q4 only ~5.5 GB Q4_K_M
4
google · Context: 8k tokens
9.2B
66.7%
64.1%
73.5%
Gemma ✓ fp16 Q4 only context 8k — limitado para RAG
5
Qwen · Context: 128k tokens
7.6B
63.2%
66.8%
72.1%
Apache 2.0 ✓ fp16 ✓ fp16
6
meta-llama · Context: 128k tokens
70.6B
72.4%
78.9%
82.3%
Llama 3.1 ✗ demasiado grande necesita multi-GPU ✗ demasiado grande
7
mistralai · MoE · Context: 32k tokens
46.7B
69.8%
70.2%
76.4%
Apache 2.0 Q4 only ~27 GB Q4 — ajustado ✗ demasiado grande
— = modelo no evaluado en ese benchmark  ·  Los scores son representativos de los leaderboards oficiales HuggingFace (MTEB, LegalBench, MMLU).
Recomendación
Top pick para Cultiva Legal AI
mistralai / Mistral-7B-Instruct-v0.3
  • Cabe en fp16 tanto en el servidor A10G (24 GB VRAM) como en el MacBook M2 Pro (16 GB), sin quantización — máxima calidad de inferencia en ambos entornos.
  • Context window de 32k tokens: suficiente para contratos y sentencias completas sin chunking agresivo.
  • Licencia Apache 2.0: uso comercial permitido, sin royalties — imprescindible para SaaS B2B con datos de clientes.
  • Benchmark LegalBench 71.8% y MMLU-Law 74.2%: rendimiento equilibrado en tareas legales para su tamaño.
  • Soporte nativo de español y gran ecosistema de fine-tuning LoRA (compatible con PEFT + bitsandbytes).
Alternativa para producción: Si el presupuesto de cómputo lo permite y se necesita mayor precisión, Qwen2.5-14B-Instruct (+2.1 pp en LegalBench, +2.9 pp en MMLU-Law) con Q4 en el A10G (~27 GB) es la siguiente opción más sólida.
Instrucciones de puesta en marcha
Servidor A10G — vLLM
# Instalar vLLM
pip install vllm

# Servir el modelo (fp16 nativo)
vllm serve mistralai/Mistral-7B-Instruct-v0.3 \
  --dtype float16 \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.90 \
  --port 8000

# Test rápido
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"mistralai/Mistral-7B-Instruct-v0.3",
    "messages":[{"role":"user","content":
    "Extrae las partes firmantes del contrato: ..."}]}'
MacBook M2 Pro — llama.cpp
# Instalar ollama (macOS)
brew install ollama

# Descargar y servir Mistral 7B
ollama run mistral:7b-instruct-v0.3

# O con llama.cpp directo (fp16)
huggingface-cli download mistralai/Mistral-7B-Instruct-v0.3 \
  --local-dir ./models/mistral-7b

llama-server -m ./models/mistral-7b/model.safetensors \
  -c 32768 --n-gpu-layers -1 --port 8080

# Estima: ~14.5 GB RAM unificada en fp16