Ejecución local de un LLM — flujo completo

Cuatro piezas. llama.cpp, Ollama, y LM Studio son diferentes frontales para el mismo flujo.

1 · Disco

Descarga del modelo

📄 qwen3.6-35b-a3b.gguf 20.4 GB
2 · Memoria

Carga en RAM

0 GB of 48 GB fast memory
3 · Server

Inicio del servidor de inferencia

localhost:1234
not running
4 · Agent

Apunta tu agente al local

$ agent-coder \
  --model lmstudio/local-model

Usa ← → para moverte. Números mostrados son ilustrativos: Qwen 3.6 35B-A3B a 4-bit con 32k de contexto en un MacBook M3 Max 64GB (~48 GB usables por la GPU). Créditos OverseedAI/little-coder-assets