Que los modelos abiertos alcancen la frontera ya no es eslogan: Xiaomi llega con MiMo v2.6 — Pro y Flash — y, de forma inusual, retransmite seis días de RL en directo con una factura cercana a 3–3,5 millones de dólares en pantalla. El narrador, que rara vez cubría a Xiaomi, los ve cerca de GPT-5.6 en varios bancos de agentes, con pesos y código publicados y generación 3D competitiva — señal de cuánto se ha estirado el ecosistema abierto chino cuando el entrenamiento se vuelve espectáculo.
Por qué importa el RL en directo
Durante el RL el equipo invirtió el guion: seis días de logs en vivo en lugar de un gráfico a posteriori, presentados como culminación de medio año de investigación. Descrito como una de las mayores asignaciones de cómputo para un modelo abierto doméstico, el gesto convierte el coste en método — como un maratón con parciales públicos, transformando presupuesto en cuaderno de laboratorio más que en marketing.
La familia son dos modelos nativos multimodales. El vídeo sitúa a Pro en torno a un billón de parámetros totales con unos dos mil millones activos por token, y a Flash en unos 310.000 millones con 15.000 millones activos — coherente con el diseño MoE documentado (mixture-of-experts — solo los expertos relevantes se activan, como una orquesta parcial) que ya llevó a V2.5 a un billón / 42.000 millones activos y contexto de un millón. Pesos en Hugging Face, tres variantes en OpenRouter y un codificador destilado de 9.000 millones (Quinn 9B) completan el conjunto.
Arquitectura y hardware aún pesados
La dispersión explica la escala: MoE mantiene modesto el cómputo por token pese a la enorme capacidad total, y la atención híbrida — local de ventana deslizante más atención global dispersa, extendida con cabezas de predicción multi-token — sostiene contexto largo sin disparar la memoria KV (alrededor de -40% frente a atención completa). Aun así el caché crece con el contexto porque pesos y trazas comparten VRAM. Un cuadro elaborado con Claude sugiere Flash en dos cajas DGX en cuantización completa, mientras Pro pide unos ocho H100 en precisión completa — la cuantización compacta pero cede algo de fidelidad.
En rendimiento el narrador evita el marcador único: en el Artificial Analysis Intelligence Index, MiMo-V2.6-Pro suma 46 puntos, por delante de Kimi K3 y Qwen3 Max como mejor modelo abierto del corte, aunque aún detrás de los sistemas cerrados punteros. El menos saturado Terminal-Bench 4.0 se destaca, donde Pro y Flash rondan el nivel GPT-5.6 Sol, corroborado por pruebas propias. En la frontera de coste, Pro luce Pareto-eficiente: alrededor de $0,43 de entrada y $0,87 de salida por millón de tokens, varias veces por debajo de pares.
El acceso mantiene la promesa abierta: pesos en Hugging Face, API en OpenRouter y Xiaomi Open Platform con identificadores en minúsculas `mimo-v2.6-pro` / `flash`, precios heredados de V2.5 y modo UltraSpeed hasta 20× más rápido. Contexto generoso de un millón de entrada, 128k de salida, y precio de entrada en acierto de caché dividido por mil cuando el prefijo ya está cacheado — con Team Token Plan y Batch API ahora en V2.6.
Verificación en arnés, no one-shots
La prueba favorita corre en el arnés DeepSeek — banco donde el agente navega y actúa con herramientas inéditas. Encargado de investigarse y construir una página de lanzamiento verificada, el modelo consume unos 45 millones de tokens, pero el 98% viene de caché — como reutilizar fotocopias. En modo medio multimodal (texto+imagen) encadena búsquedas, capturas y reverificaciones; la página de primer intento impresiona por fidelidad a los temas y animaciones del blog para Pro y Flash, presentada como prueba de que los bucles verificados reflejan ingeniería real, no destellos.
Un interludio patrocinado separa dos búsquedas: la web general, resumen optimizado para relevancia y a menudo apoyada en blogs SEO, frente al Developer Index de Firecrawl, que indexa issues de GitHub en vivo, PR fusionadas y registros de cambios para entregar la fuente primaria. En una migración XM 7→8 ambas hallan la corrección sintáctica, pero el índice expone las PR fusionadas y caza un wildcard donde los blogs fijan la versión equivocada — con 500 créditos gratis vía MCP para empezar.
Las demos prueban robustez: una llamada a API en vivo sigue a la ISS con precisión en un mapa día/noche, un tablero de damas subraya la órbita, y el agente incluso empieza a descargar imágenes de la ISS para modelarla en Blender antes de ser detenido. Los recursos Blender se crean y animan por código, el 3D procedimental vía 3D Gaussian Splatting se juzga decente pero no líder — DeepSeek 4.1 Flash sigue delante — y el razonamiento espacial apenas correcto. Juegos y visuales ya son mínimo; la prueba es el bucle verificado.
El cierre abre hacia la ciencia: experimentos informan matemáticas formales resueltas con Lean, más señales tempranas en ciencia de materiales y bioquímica, sin RL específico de dominio. El narrador marca su no experiencia pero deja el marco claro: el código es ya suelo común, la próxima frontera es el mundo físico y la investigación, y las primeras pruebas de utilidad de pesos abiertos en esos terrenos son la promesa real, siempre que la apertura siga siendo reproducible.
Comentario de la IA
"Mi lectura es que la señal real de MiMo v2.6 está en el método: transmitir seis días de entrenamiento en vivo convierte opacidad en rendición de cuentas, y presentar 3,5 millones como transparencia hace creíble la frontera a precio contenido."
Evaluación de la IA
En su versión más fuerte, MiMo v2.6 sostiene que pesos abiertos + código + cuaderno RL en vivo acercan la reproducibilidad a la frontera sin factura de frontera; 46 puntos en el índice y un buen Terminal-Bench 4.0 lo anclan en medición. Con bucles verificados en arnés, la implicación es un subagente fiable para tareas bien acotadas, aunque aún no el mejor orquestador general.
Los límites están en la letra pequeña: Pro pide unos ocho H100 en precisión completa y un caché KV que crece con el contexto — abierto no es ejecutable en portátil, sino a escala empresa. La comparación Firecrawl es una sola ventana XM 7→8 con patrocinio, sin ablación independiente, y el propio vídeo califica el razonamiento 3D/espacial como apenas correcto, por detrás de DeepSeek 4.1 Flash.
En procedencia, precios y marcadores son verificables (tarifas Xiaomi, llm-stats, Artificial Analysis), pero la narrativa RL en vivo descansa en logs de un solo actor sin reproducción independiente; la prueba prometida del codificador destilado 9B recuerda que la evidencia llega por entregas. Las repeticiones independientes serán la prueba ácida.
En la práctica, Flash atrae para llamadas de agente de alta frecuencia, flujos de documentos con contexto largo y batch donde importa el coste por inteligencia; para razonamiento pesado y frontera, Pro aún puede quedar detrás. Decida por su propia tasa de acierto de caché — no el 98% escaparate — y por la factura de hardware con caché, y haga A/B contra una referencia cerrada antes de migrar.
Fuentes
7 enlaces; 2 de ellos también citados por 1 otra noticia. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Lanzamiento Xiaomi MiMo v2.6
- @mimo.mi.com https://mimo.mi.com/docs/en-US/news/latest/v2-6
También citado por: Xiaomi MiMo-V2.6 Pro Tops Open-Weights: 1M Context and 20x UltraSpeed at Record Price-Performance
- @huggingface.co https://huggingface.co/collections/XiaomiMiMo/mimo-v26
- @artificialanalysis.ai https://artificialanalysis.ai/models/mimo-v2-6-pro
También citado por: Xiaomi MiMo-V2.6 Pro Tops Open-Weights: 1M Context and 20x UltraSpeed at Record Price-Performance
- @mimo.mi.com https://mimo.mi.com/docs/price/pay-as-you-go
- @xiaomi-mimo-ai.com https://www.xiaomi-mimo-ai.com/research/mimo-architecture.html
- @llm-stats.com https://llm-stats.com/models/compare/mimo-v2-6-pro-vs-mistral-large-3-2509
xiaomi · mimo v2.6 · modelo abierto · aprendizaje por refuerzo · ia · agente · 3d