Volver al inicio

La semana de IA más densa: modelos de mundo, pesos abiertos y centros de datos en el espacio

En una sola semana llegaron a la vez tres modelos de mundo, cuatro nuevos modelos de lenguaje con pesos abiertos, dos modelos estrella de robótica y un plan de infraestructura de IA en el espacio. Lo importante no es el número de modelos, sino cómo cada versión cambia el coste y la licencia.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — nX0fgBL3sIM
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

La actualidad de IA de esta semana fue mucho más allá del habitual anuncio de un modelo. En siete días llegaron juntos tres modelos de mundo, cuatro modelos de lenguaje con pesos abiertos, dos modelos estrella de robótica, varios modelos pequeños para dispositivos y una iniciativa de infraestructura de IA en el espacio. El cuadro que emerge es el siguiente: las cargas de trabajo que quedan se concentran en modelos con pesos abiertos, síntesis de voz en tiempo real y simulación del mundo físico. En el lado cerrado, la tendencia no es una marcha ascendente única sino una cartera que se divide en escalones de coste distintos dentro de una misma familia.

Tres modelos de mundo, todos tras una memoria tridimensional

El trío más visible de la semana formaron modelos que buscan memoria la generación de vídeo mediante una memoria tridimensional. WorldCrafter construye un mundo explorable a partir de un solo texto o imagen de referencia y, al hacerlo, reconstruye una nube de puntos 3D , de modo que los objetos no desaparecen cuando apartas la mirada. La entrada arXiv del trabajo, titulada WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory, resume ese enfoque. La página del proyecto lo dice de forma simple: explorar un mundo generado no debería significar perderlo en cuanto apartas la vista. La segunda herramienta, MirrorScene, resuelve un problema completamente distinto: aquí no hay vídeo, solo una fotografía. Segmenta los objetos, estima la profundidad de la escena, genera geometría 3D para cada uno y luego los recoloca para que la reconstrucción coincida con la imagen original. Así cada objeto de una foto queda seleccionable por separado y puede importarse en Blender o conectarse a un simulador físico para entrenar robots. A diferencia de muchos métodos de reconstrucción a partir de una sola imagen que devuelven una malla fusionada, este enfoque mantiene los objetos separados, lo que hace que la cadena de trabajo sea usable hoy.

El tercero, GAE, toma su nombre de Geometry-Native Autoencoder, y el título del trabajo enuncia la tesis sin rodeos: el espacio latente aprendido es de naturaleza geométrica. El trabajo describe un modelo que no solo genera vídeo sino que además produce un mapa de profundidad, una trayectoria de cámara y una reconstrucción 3D de la escena. El hecho de que el peso total se mantenga por debajo de 12 GB y que el código de entrenamiento y evaluación se publique junto al modelo indica que el campo ya no se conforma con generar secuencias bonitas: busca experimentos reproducibles.

La batalla de los pesos abiertos es sobre todo una batalla de coste unitario

Lo que descolocó la clasificación de pesos abiertos fue menos el índice de inteligencia que el coste por tarea . El MiMo-V2.6-Pro de Xiaomi se quedó con el primer puesto de la lista de modelos abiertos de Artificial Analysis (artificialanalysis.ai) (artificialanalysis.ai), y la página de comparación lo coloca junto a GLM-5.3 mostrando una diferencia de alrededor de un punto. VentureBeat informó de que el modelo tomaba el primer puesto del mundo abierto después de DeepSeek. El modelo ronda el billón de parámetros, pero solo se activa una fracción pequeña en cada ejecución. Ese diseño disperso es lo que evita volver inviable el servicio. La versión Flash de la misma familia es más pequeña y más barata. Las fichas de modelo y las recopilaciones de precios independientes sitúan el escalón Pro en decenas de céntimos por tarea y Flash alrededor de doce céntimos. Lo interesante no es dónde se recortó el coste, sino qué trabajo ha dejado de ser caro: automatizar una llamada utilitaria de dos segundos ya no exige un modelo generalista de frontera. La ficha del modelo en Hugging Face también detalla el reparto entre parámetros activos y totales. La ficha del repositorio en GitHub confirma esa misma arquitectura.

Un segundo laboratorio chino, StepFun, también presentó su modelo estrella. Step 5 Preview es un modelo de mezcla de expertos con 600.000 millones de parámetros en total, de los que 27.000 millones están activos, una división que la ficha de Hugging Face (huggingface.co) indica explícitamente. Admite una ventana de contexto de un millón de tokens y prioriza la ingeniería de software y la investigación financiera. La página de comparación de Artificial Analysis muestra a Step 5 con alrededor de un punto de retraso respecto a GLM-5.3 en el índice, con un coste unas tres veces menor.

La tercera salida con pesos abiertos es la que menos atención llamar. El modelo dots3-note preview utiliza una arquitectura dispersa de 280.000 millones de parámetros en total y 16.000 millones activos, con una ventana de contexto de 512.000 tokens. Su ficha en Hugging Face (huggingface.co) muestra mejor que ninguna por qué un modelo de ese tamaño se acerca a rivales mucho mayores: la prueba ARC-AGI , que mete a un modelo en un entorno de juego que nunca ha visto y le pide deducir las reglas por sí mismo. Como los pesos de un transformador son fijos, ese tipo de pruebas es extremadamente difícil para la mayoría de los modelos; la versión FP8, con aproximadamente la mitad del tamaño completo, importa para el despliegue práctico. Los modelos pequeños de un solo uso forman una corriente secundaria interesante. Limite 1B de Paradigma es un modelo de mil millones de parámetros creado solo para problemas matemáticos difíciles, con una puntuación de alrededor del 94 por ciento en la prueba de matemáticas competitivas de su ficha y un paquete completo por debajo de dos gigabytes. La versión orientada a seguridad de la semana, Aikido Altar, está construida sobre GLM-5.3 y comprimida por debajo de 400 GB en INT4 retirando parte de su conjunto de expertos. El resultado de la prueba de seguridad que figura en la ficha de AikidoSec muestra que la versión reducida conserva la mayor parte de la capacidad del modelo completo.

Voz, robótica y el hardware de la órbita

Los nuevos modelos de síntesis de voz de Google llevan la historia de audio de la semana. Gemini 3.8 Flash TTS y su versión más barata Flash-Lite permiten diseñar una voz completamente nueva a partir de una indicación escrita, y la documentación del modelo hace énfasis en la fidelidad de calidad estudio, la actuación expresiva y los acentos regionales auténticos. La entrada de blog de Google confirma que ambos modelos se anunció juntos y están disponibles en AI Studio y en la API de Gemini.

La robótica trajo dos enfoques distintos. Black Forest Labs (bfl.ai), conocida por sus modelos de imagen y vídeo, entregó esta vez un modelo de acción para robots: FLUX 3 Action recibe un fotograma de cámara y una instrucción textual y devuelve los siguientes dos segundos de acciones en forma de modelo de acción-mundo con pesos abiertos de siete mil millones de parámetros. La entrada de blog de Hugging Face (huggingface.co) y The Decoder (the-decoder.com) indican que quedó primero en la clasificación RoboLab tras ajustar el modelo con el conjunto de datos DROID, y la ficha del modelo sitúa los pesos en torno a catorce gigabytes. Ese tamaño lo convierte en un candidato práctico para el control de robots en tiempo real. La idea de Sistema Uno también encontró una versión abierta esta semana. Al explicar una clase de modelos que deciden rápido e inmediatamente en lugar de razonar durante mucho tiempo, el ponente señala a CLM, publicado conjuntamente por Stanford y Nvidia. CLM-8B devuelve una puntuación de probabilidad para cada opción en lugar de generar una secuencia de tokens, y las pruebas lo muestran hasta nueve veces más rápido que el modelo JEVA anterior, con una tasa de éxito comparable en la mayoría de las situaciones. La razón es sencilla: muchos estados de juego o de vehículo se reducen a una observación instantánea más una elección. Black Forest Labs destaca ese mismo giro en su propio anuncio.

El proyecto Sun Catcher de Google es la entrada más ambiciosa y menos madura. Reuters informó de que la empresa planea lanzar un satélite experimental con procesadores de IA de generación Trillium, mientras que Ars Technica (arstechnica.com) señala que el satélite se limitará a cuatro chips que funcionan en bloques de quince minutos. La entrada de investigación de Google describe el objetivo como equipar constelaciones de satélites solares con procesadores y enlaces ópticos en espacio libre. En órbita baja el sol es continuo, lo que produce mucha más energía solar que en tierra, y hay cuatro obstáculos que deben resolverse: vibración de lanzamiento, radiación, refrigeración y el propio enlace láser. La ventana de prueba que recoge Ars Technica muestra lo temprano que sigue el programa.

Los modelos cerrados se dividen en escalones de coste

En el lado cerrado, OpenAI presentó los escalones medio y barato de la familia GPT-6. El anuncio describe tres clases ordenadas de la más a la menos capaz, con el escalón intermedio Sol bastante más barato que la clase más cara. La versión Luna se posiciona en torno a siete céntimos por tarea, orientada a trabajos rápidos y sencillos. Esta semana la brecha de precios de los modelos cerrados se amplió en dos órdenes de magnitud, y la comparación con la versión de Claude más barata muestra un factor de varios cientos.

El Opus 5.5 de Anthropic fue la gran salida cerrada de la semana. El anuncio de Anthropic define el modelo como el primer miembro de la familia Claude 5.5, y la documentación de la plataforma indica una ventana de contexto de un millón de tokens con precios de cuatro dólares por millón de tokens de entrada y veinte por millón de salida. Las pruebas del propio ponente lo encuentran muy fuerte en diseño 3D, programación y trabajo con interfaces web, señalando al mismo tiempo que su inteligencia está cerca de GPT-6 Astra y que su coste por tarea sigue siendo notablemente más alto. El anuncio más disputado fue el descubrimiento de Claude en datos genómicos. Anthropic indica que unos mil agentes buscaron secuencias repetidas durante 21 horas y 210 millones de tokens, y presenta lo encontrado como un mecanismo similar a CRISPR. El reportaje de The Verge (theverge.com) se detiene exactamente ahí: el hallazgo aún no está verificado e investigadores del campo consideran que no es una prioridad principal. La formulación de Anthropic, en cambio, hace énfasis en que los agentes exploraron de forma independiente un conjunto masivo de secuencias y redujeron los resultados a una candidata digna de probar, que es la parte que realmente funciona. The Verge sitúa esa advertencia en el cuerpo de su reportaje.

Evaluación y conclusión práctica

El verdadero titular de la semana no es el número de productos lanzados sino el deslizamiento del coste unitario. La comparación de modelos abiertos de Artificial Analysis muestra que un precio de doce céntimos por tarea es hoy realmente alcanzable, mientras que la misma clasificación en el lado cerrado sigue en el rango de los decenas de dólares. Eso convierte la pregunta de cuál es el mejor modelo en cuál es el modelo adecuado para cada trabajo, y cambia la lógica de decisión de los desarrolladores.

Una segunda limitación no está en los modelos sino en la infraestructura de medición. Cuando las comparaciones de un fabricante y la clasificación de un organismo de evaluación independiente divergen, una diferencia de un punto en el índice deja de significar nada. En el caso de Grok 4.7 las comparaciones del propio fabricante son favorables, mientras que la evaluación independiente sitúa al modelo por detrás en el índice y caro por tarea. Una tercera limitación tiene que ver con lo que significan los pesos abiertos en la práctica. La escala vive ahora en el tamaño de los archivos : 573 GB para la familia MiMo, 577 GB para dots3-note. Esa tabla recuerda que un modelo con pesos abiertos está abierto a quien tenga hardware suficiente, que es un grupo mucho más estrecho de lo que sugiere el eslogan. La comparación de modelos abiertos de Artificial Analysis acota esa diferencia a alrededor de un punto.

La conclusión práctica es sencilla: deja de preguntar qué modelo es más inteligente y empieza a preguntar qué modelo debe hacer qué trabajo. Para tareas largas y sensibles al coste, las versiones abiertas baratas ya son suficientemente buenas. En síntesis de voz, construcción de mundos 3D y control de robots, la cadena de herramientas se ha montado tan rápido que el panorama a fin de año se verá casi con seguridad muy distinto del de principios de año.

Visualization: nodesdaily AI

Momentos clave

  1. La visión general de la semana
  2. WorldCrafter y la memoria 3D
  3. El modelo de diseño Ming-Image
  4. MirrorScene y el flujo de trabajo en Blender
  5. Control robótico con FLUX 3 Action
  6. Gemini 3.8 Flash TTS
  7. MiMo-V2.6-Pro toma el liderazgo abierto
  8. Step 5 y el trabajo agéntico
  9. OpenMuse y los agentes personales
  10. CLM y la idea de Sistema Uno
  11. Evaluación de Grok 4.7
  12. GPT-6 Sol y Luna
  13. Claude Opus 5.5
  14. El descubrimiento genómico de Claude
  15. Robots: UBTECH, Unitree, Skild AI
  16. Sun Catcher y la infraestructura orbital

Comentario de la IA

"El número de lanzamientos es impresionante, pero la historia real está en las tablas comparativas, no en los comunicados. Pocos dólares de diferencia dentro de una misma familia pueden mover una carga de trabajo de un escalón a otro. El salto de los pesos abiertos es real; lo que sigue incierto es la durabilidad de la curva de precio y rendimiento de los modelos cerrados."

Evaluación de la IA

La objeción más fuerte es que buena parte de la salida de esta semana se presentó como mucho más grande de lo que es en el uso real. Los movimientos en las clasificaciones de modelos con pesos abiertos en particular deben leerse en un momento en el que distintas infraestructuras de evaluación producen órdenes distintos. En cuanto se abre una brecha entre las pruebas del fabricante y la clasificación de un organismo independiente, una diferencia de un punto deja de significar nada.

Lo que falta son datos a largo plazo sobre la solidez de estos sistemas en el mundo real. El modelo de acción robótico, el motor de juegos y las pruebas de interfaz web se superan en entornos cortos y controlados; aún se desconoce cómo se comportan esos mismos sistemas en entornos abiertos, complejos y parcialmente impredecibles. El patrón común de estas demostraciones es un resultado brillante bajo condiciones controladas y una fragilidad inesperada fuera de ellas.

También conviene atender a los intereses del ponente. Elogiar cada producto por igual en un recorrido semanal deja al espectador ante una tabla inflada. Dado el estado actual de la infraestructura de medición, casi imposible que un solo canal evalúe correctamente quince productos distintos en una sola entrega. Estos recorridos tienen valor porque hacen visible la distancia entre las afirmaciones del fabricante y la clasificación de un organismo independiente, pero por sí solos no bastan para tomar una decisión.

La conclusión práctica para el lector es esta: preguntar qué modelo debe hacer qué trabajo en lugar de cuál es más inteligente. Para tareas largas y sensibles al coste, las versiones abiertas baratas ya son suficientemente buenas. En síntesis de voz, construcción de mundos 3D y control de robots, la cadena de herramientas se ha montado tan rápido que el panorama a fin de año será casi con seguridad muy distinto del de principios de año.

Fuentes

22 enlaces; 9 de ellos también citados por 17 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

inteligencia artificial · modelos con pesos abiertos · robotica · modelos de mundo · sintesis de voz · infraestructura espacial

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…