Modelos publicados en silencio bajo nombres en clave preview , que luego obligan a retestear todo en el lanzamiento oficial: el presentador está visiblemente cansado de este ciclo. Aun así, con los espectadores pidiendo LongCat con insistencia en los comentarios, se puso manos a la obra. LongCat 2.0 había sido tan malo que ni siquiera entró en su tabla de código y se borró de la memoria. Ahora llega 2.5, gratis por dos semanas; las condiciones parecen dadas para un video corto y un veredicto rápido.
La rutina de prueba tiene dos capas, como siempre. Primero se ejecutan 24 prompts de código y se cuentan las pruebas superadas; luego la calidad del código generado se puntúa bajo arbitraje de GPT-5.6. La revisión de calidad mira dos pistas distintas: un frontend de React y TypeScript dentro de un mismo proyecto, y un backend de PHP y Laravel en una pista separada. El techo es de 60 puntos y el presentador hace la actualización en vivo en pantalla; las expectativas empiezan bajas porque el modelo no viene ni de un laboratorio establecido ni de un pasado brillante.
Su Lugar en la Tabla
Al refrescarse la tabla, la predicción se confirma: LongCat 2.5 Preview aparece en los puestos bajos, no en el fondo pero lejos de la cima. Con 44 puntos en total, el modelo nunca se acerca a los líderes que orbitan entre 50 y 57. El detalle más llamativo que queda en acta es el reparto por lenguaje: apenas 0,9 sobre 5 en el proyecto Go frente a 4 sobre 5 en Dart y Flutter. Cuatro de cinco proyectos no muestran ninguna prueba fallida, así que el modelo termina la mayoría de los trabajos, pero su tiempo de llegada pone a prueba la paciencia.
Es el retrato de un modelo que termina pero que tarda. La ejecución sufrió fallos intermitentes y los tiempos de respuesta agotaron al presentador; sin la gratuidad, jamás entraría en una lista de recomendaciones. El veredicto, con todo, no es del todo sombrío: se lo juzgó suficiente para tareas pequeñas e inscribió su nombre en la tabla con un puntaje distinto de cero. No hay salto que cierre la brecha hacia la cima, pero tras el desempeño insignificante de 2.0, 2.5 muestra al menos una presencia medible.
Precio, Identidad y Cola Gratuita
La ficha de identidad del modelo merece atención. LongCat es el brazo de IA del gigante del reparto Meituan; según el blog oficial de LongCat, la versión 2.0 porta una arquitectura MoE de 1,6 billones de parámetros , con unos 48.000 millones de parámetros activos por token y un contexto de un millón de tokens. Según Reuters, el modelo se entrenó en un clúster de 50.000 chips totalmente domésticos. Las mediciones internas compartidas en el repositorio oficial de GitHub marcan 70,8 en Terminal-Bench 2.1 y 59,5 en SWE-bench Pro, y la página de pesos abiertos en Hugging Face confirma el cuadro. En el sitio oficial, el precio preview de 2.5 iguala al de 2.0 — 30 centavos la entrada y 1,20 dólares la salida por millón de tokens — con una etiqueta de descuento que advierte abiertamente de una posible subida posterior. Detalle revelador: el modelo está ausente de OpenRouter, así que el acceso fluye en la práctica por OpenCode.
El flanco de acceso gratuito es la parte más práctica del video. Según la documentación Zen de OpenCode, el modelo identificado como longcat-2.5-preview-free es gratis tanto en entrada como en salida, y el catálogo rota otras opciones a precio cero como MiMo-V2.6-Flash Free y MiMo-V2.5 Free. En el TUI, la lista que abre el comando /models destaca estos modelos al instante con el filtro free. Para comparar precios, el presentador cita la gama GPT-5.6 Luna: 20 centavos de entrada, 1,20 dólares de salida. LongCat cuesta algo más con 30 centavos de entrada mientras GPT-6 Luna es mucho más barato; pero según el presentador, la calidad de LongCat queda detrás de GPT-5.6 Luna y con más lentitud, así que lo barato nunca decide por sí solo.
La Corrección de MiMo y el Dilema Preview
La subtrama sorpresa del video es el tema de la víspera: MiMo-V2.6-Flash. Una hora después de emitido ese video, el equipo del modelo anunció que había diagnosticado y corregido un error de repetición de llamadas a herramientas, que debería acelerar el modelo y quizá elevar su calidad. El presentador hizo una comprobación de una sola consulta sin ver mejora visible; el modelo sigue juzgándose muy lento, con una reprueba completa prevista en la semana. Mientras tanto, MiniMax espera turno: según MiniMax, el M3 de pesos abiertos obtiene 83,5 en BrowseComp, mientras que la ficha MiniMax-M3 en Hugging Face marca 80,5 en SWE-bench Verified y 59,0 en SWE-bench Pro. En el final, el presentador plantea un dilema honesto: ¿probar la preview ahora o esperar la versión oficial, sobre todo cuando circulan teorías de debilitamiento discreto de las versiones oficiales? Deja la respuesta en los comentarios e invita a quien sepa más de LongCat a enriquecer el debate.
Momentos clave
Comentario de la IA
"Una prueba de código independiente que trata a un modelo preview con tanta distancia es valiosa; los puntajes dicen más que las pulidas tablas de lanzamiento. La ventana gratuita de LongCat 2.5 merece una prueba, pero es pronto para código de producción."
Evaluación de la IA
El contraargumento más fuerte es este: una sola prueba independiente, por transparente que sea, no decide el destino de un modelo. La rutina de 24 prompts del presentador se siente más auténtica que los benchmarks internos porque se apoya en tareas reales de usuarios, pero una sola ejecución sobre una muestra pequeña está expuesta al ruido estadístico. Además, la silla del juez la ocupa la familia GPT-5.6, y a juzgar por la lista Zen de OpenCode, miembros de esa misma familia también compiten en la carrera: el árbitro y el competidor son parientes. Lean esos 44 puntos no como un veredicto absoluto sino como la medición única de un solo laboratorio.
El video también tiene vacíos. La sensación de lentitud nunca se cuantifica; sin tokens por segundo, tiempos de cola ni tasas de reintento, la queja de velocidad queda en impresión. La causa raíz del colapso a 0,9 sobre 5 en el proyecto Go nunca se investiga; no se sabe si el modelo desconoce el lenguaje o si el arnés de pruebas es frágil. No se traza ningún vínculo entre esa lentitud y la afirmación del clúster doméstico de 50.000 chips reportada por Reuters. Y la teoría del presentador sobre caídas de puntaje tras la preview flota como una sospecha sin probar.
El posible interés del presentador también merece nota. Un formato centrado en modelos gratuitos atrae tráfico constante hacia los modelos gratuitos rotativos de la lista Zen de OpenCode, y cada nueva preview significa un video nuevo. Pero publicar los puntajes sin censura y relegar el modelo a los puestos bajos demuestra que este formato no es un folleto publicitario. Colocar lado a lado los récords internos del blog oficial de LongCat, como el 70,8, y los 44 puntos del video ofrece al lector un equilibrio sano.
La conclusión práctica para los lectores es clara. Para scripts pequeños, proyectos de prueba y curiosidad, la cola longcat-2.5-preview-free es una parada sensata; allí se conoce el carácter del modelo sin gastar un centavo. Pero para trabajos con plazos, para lenguajes como Go y para bucles de agentes donde la velocidad importa, manténganse fieles a los modelos punteros. Antes de convertir puntajes preview en una decisión de compra, esperen la versión oficial y al menos una reprueba independiente.
Fuentes
8 enlaces; 2 de ellos también citados por 1 otra noticia. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — LongCat 2.5 Preview coding test
- @opencode.ai OpenCode Zen — models and free pricing
También citado por: Gemini 4 Pro Leaks, Rogue Agents and China's 10-Trillion-Parameter Plan: One Day of AI Headlines
- @longcat.ai LongCat official blog — LongCat 2.0 specs
- @github.com GitHub — meituan-longcat LongCat-2.0 repository
También citado por: Gemini 4 Pro Leaks, Rogue Agents and China's 10-Trillion-Parameter Plan: One Day of AI Headlines
- @reuters.com Reuters — Meituan domestic-chip training report
- @huggingface.co Hugging Face — LongCat-2.0 open weights
- @minimax.io MiniMax — M3 model page
- @huggingface.co Hugging Face — MiniMax-M3 model card
longcat · inteligencia artificial · código · opencode · mimo · minimax