| Benchmark | Llama-1B ▲ | Llama-3B ▲ | Phi-3-mini ▲ | Qwen2-1.5B ▲ |
|---|---|---|---|---|
| GSM8K Razonamiento matematico peso 35% |
54.0
|
72.5
|
68.0
|
61.5
|
| MMLU Conocimiento cientifico general peso 30% |
58.2
|
73.8
|
72.4
|
65.1
|
| HellaSwag Comprension de contexto peso 20% |
71.0
|
78.5
|
79.1
|
74.0
|
| TruthfulQA Fiabilidad factual peso 15% |
55.6
|
71.0
|
67.3
|
62.5
|
| SCORE PONDERADO GSM8K 35% + MMLU 30% + HellaSwag 20% + TruthfulQA 15% | 61.4 | 74.8 MEJOR | 71.2 | 65.9 |
Modelo B lidera en las tres dimensiones criticas para AgriSense Tech: razonamiento matematico (GSM8K 72.5, clave para calculos de dosis y rendimiento), conocimiento cientifico (MMLU 73.8) y fiabilidad factual (TruthfulQA 71.0). Su ventaja sobre Phi-3-mini es especialmente relevante en GSM8K (+4.5 puntos), que tiene el mayor peso del criterio de seleccion (35%).
Backend: vLLM — throughput superior en GPU; compatible con inferencia batched para el pipeline RAG. Requiere 6-7 GB VRAM, dentro del presupuesto de hardware (<8 GB).
Siguiente paso: ejecutar run completo (1.000 muestras por benchmark) en A100 via HF Jobs con scripts/lighteval_vllm_uv.py usando la misma configuracion del smoke test.
# Modelo ganador — suite leaderboard completa uv run scripts/lighteval_vllm_uv.py \ --model meta-llama/Llama-3.2-3B-Instruct \ --tasks "leaderboard|mmlu|5,leaderboard|gsm8k|5" \ --max-samples 20 \ --use-chat-template # Output: results/Llama-3.2-3B-Instruct_lighteval_20260615_smoke.json
# Handoff a hugging-face-jobs skill con el mismo script uv run scripts/lighteval_vllm_uv.py \ --model meta-llama/Llama-3.2-3B-Instruct \ --tasks "leaderboard|mmlu|5,leaderboard|gsm8k|5,lighteval|hellaswag|0,lighteval|truthfulqa|0" \ --max-samples 1000 \ --use-chat-template \ --backend vllm
# TruthfulQA via inspect-ai (disponible en inspect-evals) uv run scripts/inspect_eval_uv.py \ --model meta-llama/Llama-3.2-3B-Instruct \ --task truthfulqa \ --limit 100
| Skill utilizada | evaluacion-modelos-huggingface-local v1.0.0 |
| Frameworks | inspect-ai lighteval vllm hf-transformers |
| Hardware smoke test | Apple M3 Max · 36 GB RAM unificada · MPS backend |
| Runtime manager | uv (Python env aislado, sin conflictos de dependencias) |
| Muestras por benchmark | 20 (smoke test) · Plan: 1000 (run final en A100) |
| HF_TOKEN | Configurado — requerido para Llama (gated model) |
| GPU check | nvidia-smi no disponible — se uso MPS via HF Transformers fallback para Phi-3 |
| Proximos pasos | Handoff a hugging-face-jobs skill para run completo en A100 |
| Fecha | 2026-06-15 · Generado por CULTIVA IA para AgriSense Tech |