← Todos los proyectos

Local AI Lab

Afirmaciones sobre modelos locales, contrastadas con mi propia VRAM

Estado Hardware personal. En curso.


Por qué molestarse

Toda afirmación sobre lo que puede hacer un modelo local vale exactamente lo que el presupuesto de hardware de quien la hace. Los benchmarks se ejecutan en tarjetas que nadie tiene en casa, y la pregunta interesante no es si un modelo es bueno, sino si es lo bastante bueno con doce gigas.


El montaje

Una RTX 3060 con 12 GB de VRAM, Ollama y LM Studio, y un conjunto fijo de tareas de desarrollo agénticas contra el que ejecutarlo todo para que la comparación signifique algo.

Entre los modelos en evaluación están Qwen, Gemma, Llama 3.1, DeepSeek R1 y Mistral Nemo.


Lo que de verdad me dice

Qué flujos de desarrollo sobreviven sin un modelo frontera y cuáles se caen en silencio. El tool calling y las integraciones MCP son donde primero se ve la diferencia: un modelo que escribe código aceptable perderá igualmente el hilo en un bucle agéntico de varios pasos mucho antes de quedarse sin contexto.

Es también donde averiguo lo que cuesta un flujo cuando el token marginal es gratis, que es la otra mitad de la pregunta que hace TokenMeter.


Stack

OllamaLM StudioMCPClaude CodeRTX 3060

Escrito en el laboratorio