Pesos modelo
14.48
GB VRAM
KV Cache (4096T)
1.06
GB VRAM
Overhead sistema
0.52
GB VRAM
TOTAL estimado
16.06
GB VRAM
$ uvx hf-mem
--model-id mistralai/Mistral-7B-v0.1
--experimental
--max-model-len 4096
--batch-size 4
--json-output
Pesos modelo
16.07
GB VRAM
KV Cache (4096T)
0.88
GB VRAM
Overhead sistema
0.54
GB VRAM
TOTAL estimado
17.49
GB VRAM
$ uvx hf-mem
--model-id meta-llama/Llama-3.1-8B-Instruct
--experimental
--max-model-len 4096
--batch-size 4
--hf-token $HF_TOKEN
--json-output
Pesos modelo
145.4
GB VRAM
KV Cache (4096T)
8.39
GB VRAM
Overhead sistema
1.20
GB VRAM
TOTAL estimado
155.0
GB VRAM
$ uvx hf-mem
--model-id Qwen/Qwen2.5-72B-Instruct
--experimental
--max-model-len 4096
--batch-size 4
--json-output
## ⚠ Requiere tensor parallelism 2× A100
Pesos (Q4_K_M)
8.37
GB VRAM
KV Cache (4096T)
1.14
GB VRAM
Overhead sistema
0.32
GB VRAM
TOTAL estimado
9.83
GB VRAM
$ uvx hf-mem
--model-id unsloth/Phi-4-GGUF
--gguf-file Phi-4-Q4_K_M.gguf
--experimental
--max-model-len 4096
--batch-size 4
--json-output
Pesos modelo
0.60
GB VRAM
Overhead sistema
0.18
GB VRAM
TOTAL estimado
0.78
GB VRAM
Coexiste con otros
tiny ✓
$ uvx hf-mem
--model-id google/embeddinggemma-300m
--json-output
Resumen ejecutivo para CULTIVA IA
Con 1× RTX 4090 24 GB podemos desplegar de forma eficiente los modelos
Mistral-7B, Llama-3.1-8B-Instruct y Phi-4 GGUF Q4_K_M,
más el modelo de embeddings coexistiendo. Estos cubren el 80% de los casos de uso de la plataforma
(copy, agente conversacional, edge). El modelo de análisis documental Qwen2.5-72B
excede la capacidad disponible y su despliegue propio no es rentable en esta fase —
recomendamos consumirlo vía API hasta superar 500 req/día donde el autohospedaje se amortice.