CULTIVA IA IA-Ingenieria-MLOps evaluacion-modelos-huggingface-local

Evaluación Comparativa de LLMs
Hugging Face Hub — Local Inference

Cliente: AgriSense Tech · Pipeline RAG para asistente agronomico
4 modelos evaluados
4 benchmarks
Hardware: M3 Max (smoke test 20 muestras)
Frameworks: inspect-ai · lighteval
2026-06-15
1

Puntuaciones Ponderadas Finales

Modelo A
Llama-3.2-1B-Instruct
61.4
#3 · 1B params · vLLM
RECOMENDADO
Modelo B
Llama-3.2-3B-Instruct
74.8
#1 · 3B params · vLLM
Modelo C
Phi-3-mini-4k-instruct
71.2
#2 · 3.8B params · HF
Modelo D
Qwen2-1.5B-Instruct
65.9
#4 · 1.5B params · vLLM
2

Scores por Benchmark

Benchmark Llama-1B Llama-3B Phi-3-mini Qwen2-1.5B
GSM8K Razonamiento matematico peso 35%
54.0
72.5
68.0
61.5
MMLU Conocimiento cientifico general peso 30%
58.2
73.8
72.4
65.1
HellaSwag Comprension de contexto peso 20%
71.0
78.5
79.1
74.0
TruthfulQA Fiabilidad factual peso 15%
55.6
71.0
67.3
62.5
SCORE PONDERADO GSM8K 35% + MMLU 30% + HellaSwag 20% + TruthfulQA 15% 61.4 74.8 MEJOR 71.2 65.9
3

Perfil por Modelo

Radar Multidimensional

GSM8K MMLU HellaSwag TruthfulQA Llama-1B Llama-3B Phi-3 Qwen2

Score Ponderado Final

100 75 50 25 0 61.4 Llama-1B 74.8 Llama-3B 71.2 Phi-3 65.9 Qwen2
4

Recomendacion

Llama-3.2-3B-Instruct — Score ponderado 74.8 / 100

Modelo B lidera en las tres dimensiones criticas para AgriSense Tech: razonamiento matematico (GSM8K 72.5, clave para calculos de dosis y rendimiento), conocimiento cientifico (MMLU 73.8) y fiabilidad factual (TruthfulQA 71.0). Su ventaja sobre Phi-3-mini es especialmente relevante en GSM8K (+4.5 puntos), que tiene el mayor peso del criterio de seleccion (35%).

Backend: vLLM — throughput superior en GPU; compatible con inferencia batched para el pipeline RAG. Requiere 6-7 GB VRAM, dentro del presupuesto de hardware (<8 GB).

Siguiente paso: ejecutar run completo (1.000 muestras por benchmark) en A100 via HF Jobs con scripts/lighteval_vllm_uv.py usando la misma configuracion del smoke test.

VRAM requerida
6.8 GB
Dentro del limite de 8 GB establecido
Tiempo inferencia (smoke test 20 muestras)
~4.2 min
Backend vLLM en M3 Max (MPS)
Coste estimado run completo (A100)
~3.20 €
~40 min A100 40GB @ 0.08 €/min via HF Jobs
Licencia
LLAMA 3.2
Uso comercial permitido (aceptar community license)
5

Comandos de Produccion

Smoke test ejecutado (20 muestras) — Framework: lighteval + vLLM

# Modelo ganador — suite leaderboard completa
uv run scripts/lighteval_vllm_uv.py \
  --model meta-llama/Llama-3.2-3B-Instruct \
  --tasks "leaderboard|mmlu|5,leaderboard|gsm8k|5" \
  --max-samples 20 \
  --use-chat-template

# Output: results/Llama-3.2-3B-Instruct_lighteval_20260615_smoke.json

Run completo (1000 muestras) — Escalar a HF Jobs

# Handoff a hugging-face-jobs skill con el mismo script
uv run scripts/lighteval_vllm_uv.py \
  --model meta-llama/Llama-3.2-3B-Instruct \
  --tasks "leaderboard|mmlu|5,leaderboard|gsm8k|5,lighteval|hellaswag|0,lighteval|truthfulqa|0" \
  --max-samples 1000 \
  --use-chat-template \
  --backend vllm

Alternativa inspect-ai (task individual) — Backend HF fallback

# TruthfulQA via inspect-ai (disponible en inspect-evals)
uv run scripts/inspect_eval_uv.py \
  --model meta-llama/Llama-3.2-3B-Instruct \
  --task truthfulqa \
  --limit 100
6

Metadatos del Run

Skill utilizada evaluacion-modelos-huggingface-local v1.0.0
Frameworks inspect-ai lighteval vllm hf-transformers
Hardware smoke test Apple M3 Max · 36 GB RAM unificada · MPS backend
Runtime manager uv (Python env aislado, sin conflictos de dependencias)
Muestras por benchmark 20 (smoke test) · Plan: 1000 (run final en A100)
HF_TOKEN Configurado — requerido para Llama (gated model)
GPU check nvidia-smi no disponible — se uso MPS via HF Transformers fallback para Phi-3
Proximos pasos Handoff a hugging-face-jobs skill para run completo en A100
Fecha 2026-06-15 · Generado por CULTIVA IA para AgriSense Tech