Retour au fil

LongCat 2.5 Preview Obtient 44 à un Test de Code en 24 Prompts : Guide d'Essai Gratuit

Au test en 24 prompts d'une chaîne de code indépendante, LongCat 2.5 Preview obtient 44 sur 60, s'effondre sur Go, se redresse sur Dart et Flutter, et reste essayable gratuitement deux semaines via OpenCode Zen.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — 6qq8EV2Jm6I
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Des modèles publiés discrètement sous des noms de code preview , puis obligeant à tout retester à la sortie officielle : l'animateur est visiblement lassé de ce cycle. Pourtant, les spectateurs réclamant LongCat avec insistance dans les commentaires, il s'y est mis. LongCat 2.0 avait été si mauvais qu'il n'avait jamais intégré son classement de code et s'était effacé des mémoires. Voici maintenant 2.5, essayable gratuitement pendant deux semaines ; les conditions semblent réunies pour une vidéo courte et un verdict rapide.

La routine de test comporte deux couches, comme toujours. D'abord 24 prompts de code sont exécutés et les tests réussis comptés ; ensuite la qualité du code généré est notée sous arbitrage GPT-5.6. L'examen qualité observe deux pistes distinctes : un frontend React et TypeScript au sein d'un même projet, et un backend PHP et Laravel sur une piste séparée. Le plafond est de 60 points et l'animateur effectue la mise à jour en direct à l'écran ; les attentes démarrent bas car le modèle ne vient ni d'un laboratoire établi ni d'un passé brillant.

Sa Place au Classement

Au rafraîchissement du tableau, la prédiction se confirme : LongCat 2.5 Preview apparaît dans le bas du classement, pas tout au fond mais loin du sommet. Avec 44 points au total, le modèle n'approche jamais les leaders qui gravitent entre 50 et 57. Le détail le plus frappant versé au dossier est la répartition par langage : à peine 0,9 sur 5 sur le projet Go contre 4 sur 5 sur Dart et Flutter. Quatre projets sur cinq n'affichent aucun test échoué, le modèle finit donc l'essentiel des tâches — mais son temps d'arrivée met la patience à l'épreuve.

C'est le portrait d'un modèle qui finit mais qui traîne. L'exécution a connu des pannes intermittentes et les temps de réponse ont usé l'animateur ; sans la gratuité, jamais il n'entrerait dans une liste de recommandations. Le verdict n'est pourtant pas entièrement sombre : jugé suffisant pour les petites tâches, il inscrit son nom au tableau avec un score non nul. Aucun bond ne comble l'écart vers le sommet, mais après la performance insignifiante de 2.0, 2.5 affiche au moins une présence mesurable.

Prix, Identité et File Gratuite

La fiche d'identité du modèle mérite l'attention. LongCat est le bras IA du géant de la livraison Meituan ; selon le blog officiel de LongCat, la version 2.0 embarque une architecture MoE de 1 600 milliards de paramètres , avec environ 48 milliards de paramètres actifs par token et un contexte d'un million de tokens. Selon Reuters, le modèle a été entraîné sur un cluster de 50 000 puces entièrement domestiques. Les mesures maison partagées dans le dépôt GitHub officiel affichent 70,8 sur Terminal-Bench 2.1 et 59,5 sur SWE-bench Pro, et la page des poids ouverts sur Hugging Face confirme le tableau. Sur le site officiel, le prix preview de 2.5 égale celui de 2.0 — 30 centimes l'entrée et 1,20 dollar la sortie par million de tokens — avec une mention de réduction qui signale ouvertement une possible hausse ultérieure. Détail révélateur : le modèle est absent d'OpenRouter, l'accès passe en pratique par OpenCode.

Le versant d'accès gratuit est la partie la plus pratique de la vidéo. Selon la documentation Zen d'OpenCode, le modèle identifié comme longcat-2.5-preview-free est gratuit en entrée comme en sortie, et le catalogue fait tourner d'autres options à prix zéro comme MiMo-V2.6-Flash Free et MiMo-V2.5 Free. Dans le TUI, la liste ouverte par la commande /models fait remonter ces modèles instantanément grâce au filtre free. Pour la comparaison des prix, l'animateur cite la gamme GPT-5.6 Luna : 20 centimes en entrée, 1,20 dollar en sortie. LongCat coûte un peu plus cher avec 30 centimes en entrée tandis que GPT-6 Luna est bien moins cher ; mais selon l'animateur, la qualité de LongCat reste derrière GPT-5.6 Luna avec plus de lenteur, le bon marché ne tranche donc jamais seul.

Le Correctif MiMo et le Dilemme Preview

L'intrigue surprise de la vidéo, c'est le sujet de la veille : MiMo-V2.6-Flash. Une heure après la diffusion de cette vidéo, l'équipe du modèle a annoncé avoir diagnostiqué et corrigé un bogue de répétition d'appels d'outils, censé accélérer le modèle et peut-être en relever la qualité. L'animateur a effectué un contrôle sur une seule requête sans y voir d'amélioration visible ; le modèle reste jugé très lent, avec un retest complet prévu dans la semaine. Pendant ce temps, MiniMax attend son tour : selon MiniMax, le M3 à poids ouverts obtient 83,5 sur BrowseComp, tandis que la fiche MiniMax-M3 sur Hugging Face affiche 80,5 sur SWE-bench Verified et 59,0 sur SWE-bench Pro. En finale, l'animateur pose un dilemme honnête : tester la preview maintenant ou attendre la version officielle, surtout quand circulent des théories d'affaiblissement discret des versions officielles ? Il laisse la réponse aux commentaires et invite quiconque en sait plus sur LongCat à enrichir le débat.

Visualization: nodesdaily AI

Moments clés

  1. Lassitude des previews et décision du test
  2. La méthode en 24 prompts
  3. Classement : 44 sur 60
  4. Chute sur Go, rebond sur Dart
  5. Prix officiel : 30 centimes et 1,20 dollar
  6. Le catalogue des modèles gratuits
  7. Correctif MiMo et question finale

Commentaire de l’IA

"Un test de code indépendant qui traite un modèle preview avec autant de distance est précieux ; les scores en disent plus que les tableaux de lancement polis. La fenêtre gratuite de LongCat 2.5 vaut un essai, mais il est trop tôt pour le code de production."

Évaluation de l’IA

Le contre-argument le plus fort est le suivant : un seul test indépendant, aussi transparent soit-il, ne scelle pas le destin d'un modèle. La routine en 24 prompts de l'animateur paraît plus authentique que les benchmarks maison car elle repose sur de vraies tâches d'utilisateurs, mais une seule exécution sur un petit échantillon reste exposée au bruit statistique. De plus, le fauteuil du juge est occupé par la famille GPT-5.6, et à en juger par la liste Zen d'OpenCode, des membres de cette même famille courent aussi la course — l'arbitre et le concurrent sont parents. Lisez donc ces 44 points non comme un verdict absolu mais comme la mesure unique d'un seul laboratoire.

La vidéo comporte aussi des lacunes. La sensation de lenteur n'est jamais quantifiée ; sans tokens par seconde, temps de file d'attente ni taux de relance, la plainte sur la vitesse reste une impression. La cause profonde de l'effondrement à 0,9 sur 5 sur le projet Go n'est jamais explorée ; on ignore si le modèle méconnaît le langage ou si le harnais de test est fragile. Aucun lien n'est établi entre cette lenteur et l'allégation du cluster domestique de 50 000 puces rapportée par Reuters. Et la théorie de l'animateur sur la baisse des scores après la preview flotte comme un soupçon non testé.

L'intérêt possible de l'animateur mérite une note. Un format centré sur les modèles gratuits draine un trafic régulier vers les modèles gratuits tournants de la liste Zen d'OpenCode, et chaque nouvelle preview donne une nouvelle vidéo. Mais publier les scores sans censure et reléguer le modèle au bas du classement prouve que ce format n'est pas une brochure publicitaire. Placer côte à côte les records maison du blog officiel de LongCat, comme 70,8, et les 44 points de la vidéo offre au lecteur un équilibre sain.

La conclusion pratique pour les lecteurs est claire. Pour les petits scripts, les projets d'essai et la curiosité, la file longcat-2.5-preview-free est une étape sensée ; on y découvre le caractère du modèle sans dépenser un centime. Mais pour les travaux avec échéances, pour des langages comme Go et pour les boucles d'agents où la vitesse compte, restez fidèle aux modèles de tête. Avant de convertir des scores preview en décision d'achat, attendez la version officielle et au moins un retest indépendant.

Sources

8 liens ; 2 d’entre eux sont aussi cités par 1 autre article. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

longcat · intelligence artificielle · code · opencode · mimo · minimax

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…