Estimador de Memoria — Modelos Hugging Face

CULTIVA IA · MLOps · Evaluación de infraestructura de inferencia

📅
Generado 2026-06-16
🔧
Herramienta hf-mem (uvx hf-mem)
🧪
Modo --experimental (KV cache)
📐
Contexto 4096 tokens · batch-size 4
👤
Proyecto Plataforma Inferencia CULTIVA IA
Infraestructura objetivo
🟢
NVIDIA RTX 4090
24 GB
VRAM GDDR6X · bandwidth 1008 GB/s · inferencia rápida
🟡
NVIDIA A100 SXM4
80 GB
VRAM HBM2e · bandwidth 2039 GB/s · modelos grandes
🔵
CPU Fallback
128 GB
RAM DDR5 · sin GPU · latencia alta · solo dev
Resultados por modelo
mistralai/Mistral-7B-v0.1
Copy generativo principal · LLM causual · bfloat16 · 7.24B params
✓ Cabe en RTX 4090 Safetensors Transformers
Pesos modelo
14.48
GB VRAM
KV Cache (4096T)
1.06
GB VRAM
Overhead sistema
0.52
GB VRAM
TOTAL estimado
16.06
GB VRAM
RTX 4090 (24 GB)
67% ✓
A100 (80 GB)
20% ✓
$ uvx hf-mem --model-id mistralai/Mistral-7B-v0.1 --experimental --max-model-len 4096 --batch-size 4 --json-output
meta-llama/Llama-3.1-8B-Instruct
Agente conversacional · instruction-tuned · bfloat16 · 8.03B params
✓ Cabe en RTX 4090 Safetensors Gated (token requerido)
Pesos modelo
16.07
GB VRAM
KV Cache (4096T)
0.88
GB VRAM
Overhead sistema
0.54
GB VRAM
TOTAL estimado
17.49
GB VRAM
RTX 4090 (24 GB)
73% ✓
A100 (80 GB)
22% ✓
$ uvx hf-mem --model-id meta-llama/Llama-3.1-8B-Instruct --experimental --max-model-len 4096 --batch-size 4 --hf-token $HF_TOKEN --json-output
Qwen/Qwen2.5-72B-Instruct
Análisis documentos complejos · LLM grande · bfloat16 · 72.7B params
✗ No cabe en RTX 4090 ✓ Cabe en A100 (ajustado) Safetensors sharded
Pesos modelo
145.4
GB VRAM
KV Cache (4096T)
8.39
GB VRAM
Overhead sistema
1.20
GB VRAM
TOTAL estimado
155.0
GB VRAM
RTX 4090 (24 GB)
646% ✗
A100 (80 GB)
194% ✗
2× A100 (160 GB)
97% ~
$ uvx hf-mem --model-id Qwen/Qwen2.5-72B-Instruct --experimental --max-model-len 4096 --batch-size 4 --json-output ## ⚠ Requiere tensor parallelism 2× A100
unsloth/Phi-4-GGUF · Q4_K_M
Despliegue edge en cliente · cuantizado 4-bit · 14.7B params originales
✓ Cabe en RTX 4090 GGUF Q4_K_M Edge / on-premise
Pesos (Q4_K_M)
8.37
GB VRAM
KV Cache (4096T)
1.14
GB VRAM
Overhead sistema
0.32
GB VRAM
TOTAL estimado
9.83
GB VRAM
RTX 4090 (24 GB)
41% ✓
RTX 3060 (12 GB)
82% ~
$ uvx hf-mem --model-id unsloth/Phi-4-GGUF --gguf-file Phi-4-Q4_K_M.gguf --experimental --max-model-len 4096 --batch-size 4 --json-output
google/embeddinggemma-300m
Embeddings semánticos · Sentence Transformer · 300M params · sin KV cache
✓ Cabe en cualquier GPU Safetensors Embedding model
Pesos modelo
0.60
GB VRAM
KV Cache
N/A
no aplica
Overhead sistema
0.18
GB VRAM
TOTAL estimado
0.78
GB VRAM
RTX 4090 (24 GB)
3% ✓
Coexiste con otros
tiny ✓
$ uvx hf-mem --model-id google/embeddinggemma-300m --json-output
Recomendaciones de despliegue

RTX 4090 24 GB — Recomendados

Qwen2.5-72B — ¡Alerta!

Resumen ejecutivo para CULTIVA IA

Con 1× RTX 4090 24 GB podemos desplegar de forma eficiente los modelos Mistral-7B, Llama-3.1-8B-Instruct y Phi-4 GGUF Q4_K_M, más el modelo de embeddings coexistiendo. Estos cubren el 80% de los casos de uso de la plataforma (copy, agente conversacional, edge). El modelo de análisis documental Qwen2.5-72B excede la capacidad disponible y su despliegue propio no es rentable en esta fase — recomendamos consumirlo vía API hasta superar 500 req/día donde el autohospedaje se amortice.