Un voyageur atterrit à Tokyo et reste muet devant la réception de l'hôtel, incapable d'aligner une seule phrase en japonais ; Peter ouvre sur cette scène et affirme que la voix deviendra bientôt notre façon principale de parler aux ordinateurs. Pour le prouver, il programme Tabi , un coach de langue qui enseigne des phrases de voyage en japonais par conversation en direct : 10 leçons de 10 phrases, dans une application web adaptée au téléphone. La coach s'appelle Yuki ; elle fait d'abord répéter les phrases, puis joue des scènes de rue pour les faire pratiquer. Peter boucle le tout en trois heures environ, dont deux consacrées aux essais. Le montage technique est documenté dans les guides Google et suit les règles de conception des api vocales en direct.
Pendant la visite, Peter ouvre l'écran de leçon et lance un appel en direct avec Yuki . La coach enseigne d'abord une salutation figée, la fait répéter syllabe par syllabe, puis plonge dans une rue de Tokyo : l'employé de l'hôtel salue, quelqu'un bloque le trottoir, et l'élève doit s'excuser poliment. Chaque leçon suit ce schéma en deux temps ; dix phrases sont enseignées une par une, puis réutilisées dans un dialogue improvisé. Un écran de parcours aligne les 10 cartes de leçon, chacune coiffée d'une mignonne image diorama dédiée à la scène. Peter précise que le même cadre servirait pour l'italien, l'espagnol ou le chinois ; seul le fichier de leçon change, le code central reste en place.
D'abord l'idée, ensuite le code : le tour du problème
Pour la première étape, Peter n'ouvre jamais son éditeur de code ; il mène un tour d'idées dans une fenêtre de discussion avec un prompt soigné. Le prompt réunit trois éléments : 100 phrases fréquentes pour un voyage au Japon, une structure en 10 leçons, et l'aspect de Tastemaker, une application qu'il a programmée auparavant. Montrer un ancien projet comme référence de style lui évite de décrire ses goûts à partir de zéro. Le prompt nomme aussi les api vocales en direct et l'outil de génération d'images. Un bon prompt est ici court, pas long ; il dit ce qui est voulu, ce qui est exclu, et ce qui vient ensuite. La phrase décisive arrive à la fin : n'écris pas encore de code, fais d'abord des recherches et pose-moi trois questions.
Une fois ses recherches terminées, l'outil de discussion pose trois questions de clarification. La première porte sur l'ambiance de l'appel en direct : Peter répond coaching d'abord, jeu de rôle ensuite. La deuxième porte sur la présentation des bulles de phrases : le trio japonais, romanisation et anglais l'emporte. La troisième porte sur les utilisateurs : comme les api vocales facturent à l'usage, Peter garde l'application personnelle au lieu de la lancer publiquement. Les mesures TokenMix confirment ce choix, car même un prix de 0,018 $ la minute devient une somme sérieuse sur des milliers d'heures. Cette réalité tarifaire renforce la thèse de l'application personnelle : petit public, petite facture, contrôle total.
Pour la deuxième étape, Peter exécute son propre fichier de spec skill , qui produit à la fois le cahier des charges et deux ou trois maquettes d'écrans représentatives. Sans designer sous la main, le skill dessine directement les scènes clés, l'écran de parcours et l'écran de leçon, liste les api à appeler et ajoute une mise en page bureau à côté des vues téléphone. Après examen, il ouvre le résultat avec human-review , un skill open source pour retoucher les specs sur place : il réécrit les textes, annote les blocs de maquette et laisse l'outil appliquer les corrections. Cette boucle façon document partagé sort les décisions de la fenêtre de discussion vers un fichier modifiable. Le spec skill vit derrière un portail payant tandis que human-review vient d'un dépôt public ; Peter lie les deux.
Première version et sécurité : la clé ne touche jamais la discussion
Pour la troisième étape, Peter bascule vers Antigravity , l'environnement de programmation agentique de Google, qui lit le cahier des charges et monte l'application complète d'un seul coup. La scène la plus instructive tourne autour de la clé api : Peter la crée dans Google AI Studio, la copie dans un bloc-notes local, puis demande à l'outil d'ouvrir le fichier .env pour y coller la clé directement. La clé ne touche jamais la fenêtre de discussion, une règle qui protège contre les fuites dans les données d'entraînement. Antigravity connaît les api Google mieux que tout outil rival, donc l'installation passe sans friction. Peter supprime la clé visible aussitôt après la démo.
La quatrième étape est la plus longue, environ une demi-heure de tests dans un outil de programmation qui pilote le navigateur. Premier bogue, le choix du micro : l'application écoute le micro du portable et ignore le micro externe de Peter jusqu'à ce que l'outil corrige le réglage. Puis vient le flux de leçon : les bulles s'affichent toutes ensemble au lieu d'apparaître une par une, et la vitesse de réponse de l'api semble lente, donc l'outil corrige le code et reteste. La correction la plus amusante est visuelle : l'application livre des images banales, alors Peter génère des scènes façon diorama avec Nano Banana et déploie le style sur les 10 leçons. La toute dernière génération d'images décrite sur les pages DeepMind rend ces scènes avec une régularité remarquable. Même l'avatar de Yuki passe d'une boule de riz à un portrait de fillette.
Pour la cinquième étape, Peter revient au contenu des leçons et ouvre un fil de contenu séparé. L'outil propose d'abord un arc allant des phrases quotidiennes vers la pharmacie et les urgences ; Peter fusionne les leçons six et sept et refuse une finale morose, donc l'ordre est remanié. Puis vient la question clé : faut-il lire pour parler ? L'outil répond non, et le programme avance sans enseigner l'écriture. Toutes les leçons atterrissent dans un unique fichier de leçon en markdown , avec dialogues de la coach et phrases cibles par leçon. Peter tranche net : l'écart entre une sortie bâclée en vibe coding et un produit de qualité tient au soin du contenu et aux tests entre amis.
Lancement et vue d'ensemble : cinq minutes sur Vercel
Pour la sixième étape, Peter expédie l'application sur Vercel , mentionnant l'option d'hébergement de Google AI Studio mais choisissant Vercel où vivent ses autres projets. L'intégration est déjà câblée, donc le prompt tient en une phrase : déploie l'application sur Vercel. Le déploiement prend cinq minutes environ pendant que l'outil répare seul une bibliothèque dépassée en racontant son raisonnement à l'écran. Une belle surprise attend sur le lien public : l'application a ajouté un code d'accès sans qu'on le lui demande, car chaque appel à l'api vocale inscrit une petite charge. Peter aime la logique même sans l'avoir demandée ; connexions, leçons supplémentaires et nouvelles langues suivront.
Le contexte technique confirme ce montage : les api vocales en direct diffusent par tranches de 20 à 40 millisecondes, produisent environ 25 jetons par seconde et plafonnent les sessions audio à 15 minutes sans compression. Le repère CreativeGenius a testé 12 400 appels réels en 90 jours ; les piles tenant le p95 sous 800 millisecondes semblent humaines, autour de 0,09 à 0,22 $ la minute tout compris. Le volet TokenMix complète le tableau avec trois grands services vocaux convergents vers 300-500 millisecondes. Le marché de Speak montre des options prêtes qui mûrissent vite, cursus d'experts et personnalisation par ia devenus standard. Les six étapes de Peter sont nettes : tour d'idées, spec et design, première version, essais, contenu, lancement. Les premières versions vont vite ; la qualité se gagne aux essais.
| Étape | Contenu |
|---|---|
| Tour d'idées | recherche par prompt et 3 questions |
| Spec et design | cahier des charges et maquettes |
| Lancement | hébergement Vercel et code d'accès |
Moments clés
Commentaire de l’IA
"Ce que je préfère ici, c'est que les phases d'essai sont célébrées, pas la première version. Consacrer deux heures sur trois au contenu et au flux montre l'écart entre installation rapide et produit de qualité. Petit public et code d'accès : des touches pratiques et astucieuses pour les applis personnelles."
Évaluation de l’IA
La contre-argumentation la plus forte est directe : avec des applications abouties comme Speak, pourquoi programmer un coach à partir de zéro ? Les tuteurs prêts à l'emploi apportent cursus d'experts, retour de prononciation mesuré et large couverture de langues qu'aucun projet de week-end n'égale. Mais la thèse de Peter est la propriété, pas la profondeur : ses propres 100 phrases pour son propre voyage, sa propre coach vocale, son propre ordre de leçons. Les produits généraux conviennent un peu à tous ; les produits personnels conviennent totalement à une personne. Cette vidéo enseigne donc une méthode, pas un produit.
Les limites sont visibles aussi. La vidéo porte un parrainage Google ; Peter dit que les avis lui appartiennent, mais la chaîne d'outils choisie pointe par construction vers un seul écosystème. La démo fluide reflète un scénario de beau jour, tandis que les repères indépendants montrent un p95 qui dépasse parfois 800 millisecondes selon l'infrastructure. Des détails comme la facturation des api et le code d'accès rappellent que c'est délicieux à échelle de loisir et coûteux à échelle publique. La voix en direct reste un coût à piloter, pas un service gratuit.
Les intérêts propres de Peter figurent au tableau : le spec skill vit derrière un portail payant, et les revenus de bulletin et de cours transitent par le même écosystème. Cela n'invalide pas la méthode, mais éclaire les accents ; l'outil open source human-review est fêté tandis que le spec skill payant passe en douceur. Peter montre pourtant de vrais écrans et du vrai code, donc le récit ne flotte jamais. Le lecteur doit distinguer nettement quelles pièces sont gratuites et lesquelles demandent paiement.
Le conseil pratique est net : choisis un petit problème personnel, mène un tour du problème en trois questions avant d'écrire du code, produis le cahier des charges avec les maquettes, expédie vite la première version et consacre l'essentiel des heures aux essais. Fais mûrir le contenu des leçons dans un fil séparé plutôt que dans le code. Un hébergement gratuit et un simple code d'accès suffisent pour lancer. Un coach fluide en trois heures prouve que le vrai travail siège dans les essais soigneux, pas dans l'installation.
Sources
7 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Peter Yang
- @ai.google.dev Google AI for Developers — Live api Best Practices
- @deepmind.google Google DeepMind — Gemini Image Nano Banana
- @antigravity.google Google Antigravity — Agentic Coding IDE
- @creativegenius.ai CreativeGenius — Voice AI Benchmark 2026
- @tokenmix.ai TokenMix — Voice AI Latency Comparison 2026
- @speak.com Speak — AI Language Learning App
vibe coding · voix en direct · apprentissage des langues · antigravity · vercel