Ejecución local de un LLM — flujo completo
Cuatro piezas. llama.cpp, Ollama, y LM Studio son diferentes frontales para el mismo flujo.
1 · Disco
Descarga del modelo
📄 qwen3.6-35b-a3b.gguf 20.4 GB
2 · Memoria
Carga en RAM
0 GB of 48 GB fast memory
3 · Server
Inicio del servidor de inferencia
localhost:1234
not running
4 · Agent
Apunta tu agente al local
$ agent-coder \
--model lmstudio/local-model
--model lmstudio/local-model
Usa ← → para moverte. Números mostrados son ilustrativos: Qwen 3.6 35B-A3B a 4-bit con 32k de contexto en un MacBook M3 Max 64GB (~48 GB usables por la GPU). Créditos OverseedAI/little-coder-assets