Volver al inicio

Programar un tutor de idiomas que habla: app de voz en 6 pasos

Peter programa Tabi, una aplicación que enseña frases de viaje en japonés por conversación en directo, en seis pasos: recorrido de ideas, spec y diseño, primera versión con Antigravity, pruebas, contenido y lanzamiento en Vercel.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — GiaDdNvsadA
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Un viajero aterriza en Tokio y se queda mudo ante la recepción del hotel, incapaz de armar una sola frase en japonés; Peter abre con esta escena y sostiene que la voz pronto será nuestra forma principal de hablar con las computadoras. Para demostrarlo programa Tabi , un tutor de idiomas que enseña frases de viaje en japonés por conversación en directo: 10 lecciones de 10 frases, en una aplicación web adaptada al teléfono. La tutora se llama Yuki ; primero hace repetir las frases, luego interpreta escenas callejeras para practicarlas. Peter cierra todo en unas tres horas, con dos dedicadas solo a pruebas. El montaje técnico está documentado en las guías de Google y sigue las reglas de diseño de las api de voz en directo.

En el recorrido, Peter abre la pantalla de lección e inicia una llamada en directo con Yuki . La tutora enseña primero un saludo fijo, lo hace repetir sílaba por sílaba y luego se sumerge en una calle de Tokio: el empleado saluda, alguien bloquea la acera y el alumno debe disculparse con cortesía. Cada lección sigue esta forma en dos fases; diez frases se enseñan una por una y luego se reutilizan en un diálogo improvisado. Una pantalla de ruta alinea las 10 tarjetas de lección, cada una coronada por una simpática imagen diorama propia de la escena. Peter señala que el mismo marco serviría para italiano, español o chino; solo cambia el archivo de lección, el código central queda intacto.

Primero la idea, luego el código: el recorrido del problema

En el primer paso, Peter nunca abre su editor de código; hace un recorrido de ideas en una ventana de chat con un prompt cuidadoso. El prompt reúne tres cosas: 100 frases frecuentes para un viaje a Japón, una estructura de 10 lecciones y el aspecto de Tastemaker, una aplicación que programó antes. Mostrar un proyecto anterior como referencia de estilo le evita describir sus gustos desde cero. El prompt también nombra las api de voz en directo y la herramienta de generación de imágenes. Un buen prompt aquí es corto, no largo; dice lo que se quiere, lo que queda fuera y lo que sigue. La frase decisiva llega al final: aún no escribas código, investiga primero y hazme tres preguntas.

Cuando la herramienta de chat termina su investigación, plantea tres preguntas de aclaración. La primera trata el tono de la llamada en directo: Peter responde tutoría primero, juego de roles después. La segunda trata la presentación de las burbujas de frases: gana el trío de japonés, romanización e inglés. La tercera trata quién usará la aplicación: como las api de voz facturan por uso, Peter la mantiene personal en vez de lanzarla al público. Las mediciones de TokenMix respaldan esta decisión, porque incluso un precio de 0,018 $ por minuto se vuelve serio en miles de horas. Esa realidad tarifaria refuerza la tesis de la aplicación personal: público pequeño, factura pequeña, control total.

En el segundo paso, Peter ejecuta su propio archivo de spec skill , que produce tanto el documento de requisitos como dos o tres pantallas representativas. Sin diseñador a mano, el skill dibuja directamente las escenas clave, la pantalla de ruta y la de lección, lista las api a llamar y añade un diseño de escritorio junto a las vistas de teléfono. Tras revisarlo, lo abre con human-review , un skill de código abierto para retocar especificaciones en su lugar: reescribe textos, comenta los bloques de diseño y deja que la herramienta aplique correcciones. Este ciclo al estilo de un documento compartido saca las decisiones de la ventana de chat hacia un archivo editable. El spec skill vive tras un portal de pago mientras human-review viene de un repositorio público; Peter enlaza ambos.

Primera versión y seguridad: la clave jamás entra al chat

En el tercer paso, Peter cambia a Antigravity , el entorno de programación agentiva de Google, que lee la especificación y levanta la aplicación completa de una sola vez. La escena más instructiva gira en torno a la clave de api: Peter la crea en Google AI Studio, la copia a un bloc local y luego pide a la herramienta abrir el archivo .env para pegarla allí directamente. La clave jamás toca la ventana de chat, una regla que protege contra filtraciones hacia datos de entrenamiento. Antigravity conoce las api de Google mejor que cualquier herramienta rival, así que la instalación sale sin fricción. Peter borra la clave visible justo después de la demo.

El cuarto paso es el más largo, cerca de media hora de pruebas dentro de una herramienta de programación que maneja el navegador. El primer fallo es el micrófono: la aplicación escucha el micro del portátil e ignora el micrófono externo de Peter hasta que la herramienta corrige el ajuste. Luego llega el flujo de lección: las burbujas aparecen todas juntas en vez de una por una, y la velocidad de respuesta de la api se siente lenta, así que la herramienta remienda el código y vuelve a probar. La corrección más divertida es visual: la aplicación trae imágenes genéricas, así que Peter genera escenas tipo diorama con Nano Banana y extiende el estilo a las 10 lecciones. La generación de imágenes más reciente descrita en las páginas de DeepMind dibuja estas escenas con notable constancia. Hasta el avatar de Yuki pasa de bola de arroz a retrato de niña.

En el quinto paso, Peter vuelve al contenido de las lecciones y abre un hilo de contenido aparte. La herramienta propone primero un arco desde frases cotidianas hasta farmacia y emergencias; Peter fusiona las lecciones seis y siete y rechaza un final sombrío, así que el orden se reorganiza. Luego llega la pregunta clave: ¿hay que leer para hablar? La herramienta dice que no, y el programa avanza sin enseñar la escritura. Todas las lecciones caen en un único archivo de lección en markdown , con diálogos de la tutora y frases objetivo por lección. Peter marca la línea con nitidez: la brecha entre una salida descuidada de vibe coding y un producto de calidad está en el cuidado del contenido y en las pruebas con amigos.

Lanzamiento y panorama: cinco minutos en Vercel

En el sexto paso, Peter envía la aplicación a Vercel , menciona la opción de hospedaje de Google AI Studio pero elige Vercel, donde viven sus otros proyectos. La integración ya está conectada, así que el prompt cabe en una frase: despliega la aplicación en Vercel. El despliegue toma unos cinco minutos mientras la herramienta repara sola una biblioteca anticuada narrando su razonamiento en pantalla. Una grata sorpresa espera en el enlace público: la aplicación añadió un código de acceso sin que nadie lo pidiera, porque cada llamada a la api de voz anota un pequeño cargo. A Peter le gusta la lógica aunque no la pidió; inicios de sesión, lecciones extra e idiomas nuevos vendrán después.

El contexto técnico respalda este montaje: las api de voz en directo emiten en fragmentos de 20 a 40 milisegundos, producen unos 25 tokens por segundo y limitan las sesiones de audio a 15 minutos sin compresión. La medición de CreativeGenius probó 12.400 llamadas reales en 90 días; las pilas que mantienen el p95 bajo 800 milisegundos se sienten humanas, en torno a 0,09-0,22 $ por minuto con todo incluido. El lado de TokenMix completa el cuadro con tres grandes servicios de voz convergiendo en 300-500 milisegundos. El mercado de Speak muestra opciones listas que maduran rápido, con planes de expertos y personalización por ia ya estándar. Los seis pasos de Peter son nítidos: recorrido de ideas, spec y diseño, primera versión, pruebas, contenido y lanzamiento. Las primeras versiones salen rápido; la calidad se gana probando.

Visualization: nodesdaily AI
PasoContenido
Recorrido de ideasinvestigación con prompt y 3 preguntas
Spec y diseñodocumento de requisitos y pantallas
Lanzamientohospedaje Vercel y código de acceso

Momentos clave

  1. Intro y presentación de Tabi
  2. Lección en directo con Yuki
  3. Recorrido de ideas y 3 preguntas
  4. Revisión de spec y diseño
  5. Antigravity primera versión
  6. Trabajo de contenido
  7. Lanzamiento en Vercel

Comentario de la IA

"Lo que más me gusta aquí es que se celebran las rondas de pruebas, no la primera versión. Dedicar dos de tres horas al contenido y al flujo muestra la brecha entre instalación rápida y producto de calidad. Público pequeño y código de acceso: toques prácticos e ingeniosos para aplicaciones personales."

Evaluación de la IA

La objeción más fuerte es directa: con aplicaciones maduras como Speak, ¿por qué programar un tutor desde cero? Los tutores listos aportan planes de expertos, corrección de pronunciación medida y amplia cobertura de idiomas que ningún proyecto de fin de semana iguala. Pero la tesis de Peter es la propiedad, no la profundidad: sus propias 100 frases para su propio viaje, su propia tutora de voz, su propio orden de lecciones. Los productos generales sirven un poco a todos; los personales sirven del todo a una persona. Este video enseña, pues, un método, no un producto.

Los límites también se ven. El video lleva patrocinio de Google; Peter dice que las opiniones son suyas, pero la cadena de herramientas elegida apunta por construcción a un solo ecosistema. La demo fluida refleja un escenario de día perfecto, mientras las mediciones independientes muestran un p95 que a veces supera 800 milisegundos según la infraestructura. Detalles como la facturación de las api y el código de acceso recuerdan que esto es delicioso a escala de afición y costoso a escala pública. La voz en directo sigue siendo un costo a gestionar, no un servicio gratis.

Los intereses propios de Peter figuran en el cuadro: el spec skill vive tras un portal de pago, y los ingresos de boletín y cursos fluyen por el mismo ecosistema. Eso no invalida el método, pero aclara los énfasis; la herramienta abierta human-review recibe aplausos mientras el spec skill de pago pasa con suavidad. Peter muestra, eso sí, pantallas reales y código real, así que el relato nunca flota. El lector debe separar con nitidez qué piezas son gratis y cuáles piden pago.

El consejo práctico es nítido: elige un problema pequeño y personal, haz un recorrido del problema en tres preguntas antes de escribir código, produce el documento de requisitos junto a los diseños, lanza rápido la primera versión y dedica la mayoría de las horas a las pruebas. Madura el contenido de las lecciones en un hilo aparte antes que dentro del código. Un hospedaje gratuito y un simple código de acceso bastan para lanzar. Un tutor fluido en tres horas prueba que el trabajo real está en las pruebas cuidadosas, no en la instalación.

Fuentes

7 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

vibe coding · voz en directo · aprendizaje de idiomas · antigravity · vercel

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…