Un agente es un modelo más un harness, el entorno que corre las herramientas, guarda el estado, administra los permisos y devuelve el contexto al modelo. Cuando el modelo corre en el equipo propio ese entorno pesa más que nunca, porque las ventanas de contexto chicas y la llamada a herramientas más débil dejan a la vista cualquier falla de diseño.
MarkTechPost publicó el 18 de septiembre un ordenamiento de 11 entornos de código abierto según lo bien que documentan la inferencia local. Todos los datos de los repositorios se leyeron en GitHub ese mismo día. El orden pondera cuatro cosas, la licencia aprobada por la OSI, los tiempos de ejecución locales documentados, el estado de mantención y los controles de seguridad.
Las tres reglas que valen para cualquiera de ellos
Primero, sube la ventana de contexto. Según la documentación de contexto de Ollama, los valores por defecto dependen de la VRAM disponible, con 4k bajo los 24 GiB, 32k entre 24 y 48 GiB, y 256k desde los 48 GiB. Esa misma página dice que los agentes y las herramientas de programación deberían recibir al menos 64.000 tokens. El arreglo es una línea, OLLAMA_CONTEXT_LENGTH=64000 ollama serve.
Segundo, elige un modelo que llame herramientas. La documentación de proveedores de Goose advierte que un modelo sin llamada a herramientas solo alcanza para completar una conversación. Con llama.cpp, la documentación de Pi señala que la opción --jinja habilita las plantillas de conversación compatibles y la llamada a herramientas.
Tercero, calcula la memoria sin engañarte. La guía local de Cline asocia 16 a 32 GB de RAM con modelos cuantizados chicos, 32 a 64 GB con modelos de programación medianos, y 64 GB o más con los modelos grandes. La página de Hermes en Ollama lista gemma4 en torno a 16 GB de VRAM y qwen3.6 alrededor de 24 GB.
1. OpenCode
OpenCode documenta tres caminos locales en su propia documentación de proveedores, que son Ollama, LM Studio y el llama-server de llama.cpp. Cada uno usa el paquete @ai-sdk/openai-compatible con una baseURL local. La documentación declara soporte para más de 75 proveedores en total.
La instalación puede ser un solo comando. La página de OpenCode en Ollama muestra ollama launch opencode y recomienda una ventana de contexto de al menos 64k tokens. La documentación del propio OpenCode agrega un consejo práctico. Si fallan las llamadas a herramientas, hay que subir num_ctx a algo entre 16k y 32k.
Trae dos agentes incorporados. build tiene acceso completo. plan es de solo lectura y pregunta antes de ejecutar comandos de consola.
Le sirve a quien quiera la configuración local mejor documentada dentro de una sola herramienta de terminal.
2. Pi
Pi es la opción minimalista. Su README le entrega al modelo cuatro herramientas, read, write, edit y bash. Deja fuera a propósito el MCP, los subagentes, el modo de planificación y las ventanas de permisos. Esas funciones llegan después, por extensiones y paquetes en TypeScript.
Pi tiene soporte nativo para el servidor enrutador de llama.cpp. El enrutador descubre varios archivos GGUF y los carga cuando se necesitan. Los modelos se administran dentro de Pi con /llama. Ollama también lo soporta, y ollama launch pi instala Pi, configura el proveedor y abre una sesión.
Hay una advertencia que importa en uso local. Pi no tiene sistema de permisos propio y corre con los permisos del usuario. El README recomienda Docker, una extensión de micro máquina virtual o un entorno aislado por políticas.
La dirección antigua badlogic/pi-mono ahora redirige a earendil-works/pi. Earendil compró Pi en abril de 2026 y su creador, Mario Zechner, se incorporó a la empresa. The Pragmatic Engineer informa que Pi es la base sobre la que está construido OpenClaw.
Está pensado para modelos locales chicos, donde una lista corta de herramientas deja más contexto libre para el código.
3. Goose
Goose documenta más tiempos de ejecución locales que cualquier otro de la lista. Su documentación de proveedores nombra Ollama, LM Studio, Docker Model Runner, Ramalama y Atomic Chat. vLLM y KServe funcionan a través del proveedor compatible con OpenAI. Los proveedores personalizados pueden saltarse la clave de API cuando el servidor es local.
El gobierno del proyecto lo diferencia. La Linux Foundation creó la Agentic AI Foundation el 9 de diciembre de 2025, con Block aportando goose. El repositorio vive ahora en aaif-goose/goose. Goose está escrito en Rust y entrega una aplicación de escritorio, una herramienta de terminal y una API. El README menciona más de 70 extensiones MCP.
La configuración con Ollama es corta. Se corre goose configure, se elige Ollama y se escribe el nombre del modelo.
Apunta a la automatización general más allá del código, bajo el gobierno neutral de una fundación.
4. Cline
Cline es la opción más sólida entre las que viven dentro del editor. Su guía local recomienda un ajuste por sobre todos los demás, activar la opción de indicación compacta para la inferencia local. También aconseja tareas acotadas y sesiones nuevas cuando el contexto empieza a crecer.
Cada edición de archivo y cada comando necesitan aprobación por defecto. La aprobación automática es opcional. Los modos de planificación y de acción separan la estrategia de la ejecución.
Hay un detalle de licencia que merece atención. El propio README de Cline dice que los complementos para JetBrains no son de código abierto. La extensión de VS Code, la herramienta de terminal y el SDK sí están en el repositorio bajo Apache-2.0.
Es la opción de quien trabaja en VS Code y quiere aprobar a mano cada paso de un modelo local.
5. OpenHands
OpenHands publica la guía local más específica de todas. Su guía de modelos locales recomienda Qwen3.6-35B-A3B como primer modelo local para probar, con fecha del 21 de mayo de 2026. Los requisitos de hardware están dichos sin rodeos. Las variantes cuantizadas piden al menos 24 GB de VRAM, o un Mac con Apple Silicon y 64 GB de memoria unificada.
La guía sobre contexto es igual de directa. Hay que fijar el largo en al menos 22.000 tokens, con 32.768 como valor recomendado. El texto advierte que el valor por defecto de Ollama, 4.096, no alcanza siquiera para la indicación del sistema.
Los usuarios de Linux se topan con una trampa. LM Studio se enlaza a 127.0.0.1 por defecto, así que un OpenHands corriendo en Docker no logra alcanzarlo. Activar la opción de servir en la red local lo resuelve.
Calza con tareas largas y aisladas en contenedor, sobre una estación de trabajo o un servidor con GPU.
6. Aider
Aider enfrenta de otra manera la llamada a herramientas débil. Sus formatos de edición hacen que el modelo devuelva los cambios como texto. El formato whole devuelve archivos completos. El formato diff devuelve bloques de búsqueda y reemplazo. Aider además manda en cada consulta un mapa del repositorio con los símbolos principales.
Su documentación de Ollama marca un riesgo real. Ollama descarta en silencio el contexto que se pasa de la ventana. Aider lo contrarresta dimensionando la ventana en cada consulta, más 8k tokens para la respuesta. La página todavía cita un valor por defecto antiguo de Ollama, de 2k.
La mantención es el punto débil. PyPI muestra la versión 0.86.2 con fecha del 12 de febrero de 2026. La entrega anterior había sido el 13 de agosto de 2025.
Sirve para programar a dos manos apoyado en git, con modelos que se complican al llamar funciones.
7. Codex CLI
Codex CLI usa licencia Apache-2.0 y trae dos proveedores locales incorporados. El código fuente define ollama en el puerto 11434 y lmstudio en el 1234. Según la página de Codex en Ollama, codex --oss usa gpt-oss:20b por defecto, y la opción -m permite elegir otro modelo.
Hay una restricción dura. Codex habla hoy solamente la API de respuestas en /v1/responses. El código rechaza wire_api = "chat" y remite a esta discusión. El servidor local tiene que exponer ese punto de acceso.
El repositorio incluye módulos de aislamiento dedicados para Linux y para Windows.
Lo van a preferir los equipos estandarizados en gpt-oss que quieran el aislamiento ya incorporado.
8. Qwen Code
El README de Qwen Code enumera los protocolos de OpenAI, Anthropic, Gemini y Qwen. Para modelos locales nombra Ollama y vLLM. El proyecto nació a partir de la herramienta de terminal Gemini CLI de Google, en su versión 0.8.2, y dejó de sincronizarse con el original en la v0.1. La instalación por npm exige Node.js 22 o superior.
Su lugar está en juntar modelos Qwen de pesos abiertos con un entorno ajustado por el mismo laboratorio.
9. Kilo Code
El README de Kilo declara que su herramienta de terminal es una bifurcación de OpenCode. Kilo cuenta que partió como una bifurcación de Roo en 2025. El 2 de abril de 2026 entregó una extensión de VS Code rehecha. Su documentación de modelos locales cubre Ollama, LM Studio y Atomic Chat. Esa misma página advierte que los modelos locales suelen quedarse sin caché de indicaciones y sin uso del computador.
Le sirve a quienes venían de Roo Code y buscan un camino mantenido con soporte local.
10. Hermes Agent
Hermes Agent, de Nous Research, es un agente de propósito general y no una herramienta de programación. Su README describe un ciclo de aprendizaje que crea habilidades a partir de la experiencia. Ollama indica que llega con más de 70 habilidades y memoria entre sesiones. La configuración apunta Hermes a http://127.0.0.1:11434/v1 y el largo de contexto se puede detectar solo. Entre las pasarelas de mensajería están Telegram, Discord, Slack, WhatsApp, Signal y el correo.
Encaja como asistente personal permanente corriendo sobre modelos locales.
11. OpenClaw
OpenClaw es el proyecto con más estrellas de esta guía. Ollama lo describe como un asistente personal que conecta servicios de mensajería con agentes de IA a través de una pasarela central. Para modelos locales, Ollama recomienda una ventana de contexto de al menos 64k. En el primer arranque aparece un aviso de seguridad que explica los riesgos del acceso a herramientas. Conviene leerlo, porque este entorno se conecta a las cuentas de mensajería del usuario.
Queda para asistentes centrados en la mensajería, en manos de alguien dispuesto a administrar esa superficie de exposición.
¿Qué conviene revisar antes de elegir?
- OpenCode documenta más caminos locales que cualquier otro entorno de programación, con Ollama, LM Studio y llama.cpp.
- Hay que fijar el contexto en 64.000 tokens antes de culpar al entorno o al modelo.
- El diseño de cuatro herramientas de Pi calza con modelos chicos, pero el aislamiento lo tiene que poner el usuario.
- Codex CLI funciona en local únicamente contra servidores que expongan la API de respuestas.
- Las licencias se revisan por componente, y el complemento de Cline para JetBrains es cerrado.




