Todo parte de un dolor familiar: ejecutar el modelo más potente para cada tarea quema la cuota de la nube en días. La causa es simple: los modelos de frontera son potentes pero igual de caros y lentos; enrutar cada pequeño arreglo por ellos infla la factura. La solución no es abandonar el modelo, sino cambiar la división del trabajo.
La fórmula cabe en una frase: Fable 5 planifica, Sonnet 5 ejecuta. Como se presenta en el vídeo, Sonnet 5 cuesta aproximadamente un quinto del nivel de Fable 5 mientras rinde cerca del modelo tope de hace unos meses. La calidad de planificación se mantiene alta mientras la factura baja.
Se describen dos patrones oficiales por el lado de Claude Code. Primero, Sonnet 5 actúa como ejecutor principal y llama a Fable 5 como asesor cuando se atasca. Segundo, Fable 5 actúa como orquestador, construye el plan y abre sesiones de trabajo en el modelo más pequeño para la ejecución. La comparación del equipo de Devin favorece el segundo camino.
La razón es la economía de la caché: un modelo asesor debe releer todo el historial del agente principal, lo que significa entrada fresca cara. El patrón de trabajadores en cambio activa contexto en caché, y una lectura de caché cuesta aproximadamente un décimo de la entrada fresca. Por eso la configuración de orquestador corre más barata.
La distinción clave aquí es compañero persistente frente a subagente de un solo uso. Un subagente clásico se cierra al terminar, y una petición de corrección lo reabre con contexto cero, así que las mismas cosas se reescriben. Una sesión de compañero persistente conserva el historial: el agente principal envía mensajes de seguimiento a la misma sesión; el historial llega desde la caché, así que es a la vez barato y potente. Los equipos de agentes más la herramienta send-message dentro de Claude Code hacen exactamente esto.
Paso de implementación uno: añadir una regla de delegación al archivo CLAUDE.md. La regla dice que tú eres el coordinador, que el diseño, la planificación y la revisión se quedan contigo; entregar la ejecución a trabajadores Sonnet; los trabajadores nunca abren agentes anidados; para trabajo complejo, escribir primero una especificación congelada en la carpeta de la tarea. En el vídeo se encarga así una app de tareas: se hacen preguntas, se aclara el plan, la especificación aterriza en un archivo, la ejecución va a una sesión Sonnet, y el resultado llega visiblemente más rápido que corriendo sobre Fable.
Paso de implementación dos: el puente Codex. Una vez instalado el plugin de Codex y recargados los plugins, una sesión de Codex puede iniciarse desde dentro de Claude Code; los comandos rescue, review, result, cancel y transfer vienen listos. El comando resume envía mensajes de seguimiento a la misma sesión de Codex. En el vídeo, la interfaz de tareas escrita primero por Claude Code recibe una pasada de Codex y el aspecto cambia visiblemente.
Paso de implementación tres: el puente universal tmux. Tmux es un multiplexor de terminal; abre varios terminales persistentes y controla cada uno por comando. Tres comandos bastan: split-window -h abre un panel nuevo a la derecha, send-keys -t escribe texto más Enter en el objetivo, capture-pane -p -t lee ese panel de vuelta. Cualquier agente que uses como un humano, incluido Gemini CLI, se convierte en trabajador bajo el agente principal.
La pieza que falta es la notificación de finalización: cómo despierta el trabajador al agente principal. Por el lado de tmux la respuesta es el comando wait-for; el trabajador señala con wait-for -S al terminar mientras el lado principal espera. La skill de agent teams abierta en el vídeo envuelve este patrón: abrir una sesión, enviar un mensaje, esperar la finalización, leer el resultado. En la demo, Codex escribe un chiste, un agente Pi lo revisa, Haiku comprueba la gramática; todo corre en paralelo y el texto final vuelve al agente principal.
Para quienes quieran una opción empaquetada, se cubren Orca y Herd. Sirven la misma orquestación con una interfaz: sesiones de trabajadores apareciendo a la derecha, una vista jerárquica a la izquierda, kanban más seguimiento de tokens. El presentador se quedó con Orca como controlador diario; open source y gratis es el plus. Camino de tmux con scripts o interfaz empaquetada, la lógica es idéntica: el cerebro caro planifica, manos más baratas ejecutan.
Comentario de la IA
""No leo este vídeo como una recomendación de huir del modelo caro, sino de usar el modelo caro solo donde se lo gana — copié esa distinción en mi propio CLAUDE.md y mi cuota dejó de derretirse.""
Evaluación de la IA
Para reforzar el otro lado: ejecutarlo todo sobre un solo modelo potente es más simple, más rápido de depurar, y para un equipo pequeño el tiempo vale más que los costes de hardware. Pagar unos dólares de API en lugar de cuidar sesiones locales atascadas es racional para la mayoría de los equipos; me tomo esa objeción en serio, acota la tesis del vídeo en lugar de refutarla.
El vídeo no aporta ninguna medición propia: la cifra del 35 % viene del banco de pruebas de Devin, no de mi máquina ni de mi repositorio. Las tareas de la demo son pequeñas, de nivel app de tareas y retoque de interfaz; el trabajo desordenado en un repositorio real multiarchivo nunca se prueba. Las pantallas de permisos y los paneles de tmux atascados se pasan por alto, y sin embargo en la práctica es justo ahí donde se pierde la mayor parte del tiempo.
También están el interés y la verificabilidad: los ratios de precio y los descuentos de caché son estacionales y provienen en parte de los proveedores, cambiando cada mes. A la hora de decidir, vuelvo a comprobar la página actual de precios de la API y las tarifas de lectura de caché; leo cada cifra del vídeo como una afirmación que hay que volver a medir el día de la decisión.
Mi conclusión práctica: esta configuración es una opción genuina para estudiantes, curiosos, cualquiera que mantenga los datos en el dispositivo o gestione varios agentes a la vez. No es para flujos de un solo agente, secretos de producción en endpoints gratuitos, ni equipos que no puedan conceder acceso de terminal a los agentes. Por mi parte, el patrón de orquestador más trabajador se quedó de forma permanente, y el puente tmux se quedó para experimentos.
Fuentes
8 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=wCSPgHpcxdc
- @cognition https://cognition.com/blog/devin-fusion
- @eesel https://www.eesel.ai/blog/devin-fusion
- @blog https://blog.laozhang.ai/en/posts/claude-code-agent-teams
- @mager https://www.mager.co/blog/2026-08-23-orchestrating-agents-with-tmux
- @codex https://codex.danielvaughan.com/2026/03/31/codex-plugin-cc-cross-model-bridge
- @coursiv https://coursiv.io/blog/claude-pricing-2026
- @morphllm https://www.morphllm.com/claude-code-api-cost
tmux · fable 5 · ahorro de tokens · equipos de agentes