Informe técnico · Pipeline de vectorización para base de conocimiento legal · Junio 2026
Para LexIA, el modelo voyage-law-2 es la elección óptima: entrenado específicamente sobre corpus legal anglosajón + traducción hispana, produce embeddings de 1024 dimensiones con ventana de 32.000 tokens — suficiente para sentencias completas. Como fallback multilingüe (castellano/catalán), se añade multilingual-e5-large para documentos de la Generalitat o en catalán.
| Modelo | Dims | Max tokens | Idoneidad legal ES | Coste / 1M tokens | Privacidad | Score total | Decisión |
|---|---|---|---|---|---|---|---|
| voyage-law-2ELEGIDO | 1024 | 32.000 | 0,12 $ | API externa | Principal | ||
| multilingual-e5-largeALTERNATIVA | 1024 | 512 | 0 $ (local) | On-premise | Catalán/CA | ||
| text-embedding-3-large | 3072 | 8.191 | 0,13 $ | API externa | Descartado | ||
| voyage-3-large | 1024 | 32.000 | 0,06 $ | API externa | Descartado | ||
| bge-large-en-v1.5DESCARTADO | 1024 | 512 | 0 $ (local) | On-premise | No ES | ||
| all-MiniLM-L6-v2DESCARTADO | 384 | 256 | 0 $ (local) | On-premise | Descartado |
Documentos PDF, XML CENDOJ, DOCX y HTML (BOE)
Elimina cabeceras, pies de página, numeración y ruido OCR
Por secciones semánticas (FJ, RA, Fallo) + fallback tokens
Añade metadatos: tribunal, fecha, área, ECLI, número
voyage-law-2 (ES) o m-e5-large (CA/multilingüe)
pgvector + HNSW index; caché Redis para queries repetidas
Los documentos legales tienen estructura predecible: Antecedentes → Fundamentos Jurídicos (FJ 1, FJ 2…) → Fallo. Se usa chunking semántico por sección; si la sección supera 800 tokens, se subdivide con solapamiento de 120 tokens.
ecli, tribunal, fecha, area, jurisdiccion — imprescindibles para filtrado pgvector
langid y enrutar catalán a multilingual-e5-large local