Esta entrevista en francés de Underscore_ abre con un estudio que afirma que la IA nunca ha tocado la productividad de oficina, y luego presenta el cuadro opuesto: se dice que los equipos que usan intensivamente asistentes de código se han transformado desde finales de 2025. El invitado es Quentin Adam, responsable de Clever Cloud, un proveedor de nube francés con más de 15 años de historia. El escenario es una empresa de 70 desarrolladores que construye cada capa del software de nube, incluida su propia base de datos, una cocina donde la tolerancia al error es casi nula.
La primera impresión de Adam estaba lejos del entusiasmo actual: describe abiertamente a los primeros modelos como loros estadísticos que no podía tomar en serio porque producían código que no compilaba. El punto de inflexión llegó con las arquitecturas de agentes construidas en torno a bucles de retroalimentación; modelo más compilador más resultados de pruebas trabajando juntos empezaron a superar su propio código. Hace unos 18 meses, una prueba en la que la máquina escribió una mejor solución más rápido que él cambió su opinión.
Una de las afirmaciones más contraintuitivas concierne a la elección del lenguaje: en lugar de JavaScript y Python, que tienen los mayores montones de entrenamiento, se recomienda Rust con su compilador estricto. La lógica es simple: en los lenguajes débilmente compilados el código malo pasa silenciosamente y explota en tiempo de ejecución, mientras que en Rust el compilador se queja ruidosamente y el modelo puede entenderlo y corregirlo. La historia bastante uniforme de Rust, sin cambios rompedores, también mantiene los datos de entrenamiento más consistentes. Se aconsejan compilaciones experimentales rápidas de principio a fin en Rust.
La historia de la adopción empresarial es material de manual: los anuncios a nivel de empresa no movieron a nadie y la resistencia fue alta. Adam se sentó junto a los ingenieros uno por uno para pruebas conjuntas; el hielo se rompió cuando un ingeniero vio cinco semanas de su trabajo reescritas mejor en dos horas. Un mandato descendente de herramienta única también fracasó; en cambio, los ingenieros obtuvieron libertad para gastar en cualquier herramienta que quisieran, prohibiéndose los planes anuales porque las herramientas caducan en menos de un año.
Que los que más rápido se adaptaron fueran ingenieros senior es un hallazgo sorprendente: responsables que nunca tenían tiempo de programar además de gestionar equipos volvieron a programar con asistentes, algunos diciendo que ahora producen el código más limpio de su vida. Escribir directamente un borrador funcional supera a escribir documentos de especificación y reuniones para formalizar ideas. Las buenas prácticas que antes se saltaban por falta de tiempo volvieron a ser asequibles.
Aquí aparece la ruptura filosófica: el desarrollador que hace que la máquina escriba código se convierte en probador, un papel que nadie encuentra glamuroso. La solución fue obligar a la máquina a escribir las pruebas: capas unitarias, de integración y basadas en simulación construidas paso a paso. Los servicios simulados y los arneses elaborados que antes se omitían por demasiado costosos se convirtieron en estándar una vez que la generación se abarató. Un enfoque de simulación derivado de FoundationDB ahora valida cada cambio automáticamente.
En seguridad, cada cambio entrante se enfrenta a pruebas de penetración automatizadas, partiendo del supuesto de que una falla que un modelo no puede encontrar es poco probable que la encuentre el modelo de un atacante, con varios modelos turnándose para atacar su propia infraestructura. Eso detectó fallas latentes desde hacía mucho que nadie había explotado. El objetivo de 2026 es audaz: ejecutar solo código de cosecha 2026 en toda la empresa y retirar 15 años de legado. Como las decisiones de arquitectura permanecen internas, esto se presenta como una reescritura de la que estar orgulloso.
Dar a la IA tareas inhumanas es el pasaje más original de la entrevista: para un monolito tocado por 30 personas, las ramas, resultados de pruebas, comentarios, correos y registros de chat se alimentan a la máquina para señalar puntos de tensión antes de la reunión semanal de sincronización. Un trabajo de documentación que a un humano le cuesta tres o cuatro días le toma a la máquina veinte minutos. Las zonas de código temidas que nadie toca y las migraciones de bibliotecas caen en la misma categoría; hacer que una biblioteca se reimplemente durante la noche con una auditoría de rendimiento por la mañana ya es rutina.
Los límites se declaran con franqueza: en la frontera de la investigación, donde casi no existe código público, como los kernels y los sistemas operativos de conmutadores, las ganancias se mantienen cerca de 1,5x y el modelo incluso puede estorbar. Los borradores y las pruebas de concepto, en cambio, ven aceleraciones de hasta diez veces. Las empresas que reportan malos resultados comparten un error: generar código sin construir a su alrededor el arnés de calidad y seguridad, produciendo código ininteligible con un modelo ininteligible y esperando que las pruebas lo remienden después.
El cierre conecta con la soberanía digital europea: el desplome de los costes de software ofrece una oportunidad para reproducir barato dependencias antiguas, y se dice que la destilación de modelos mantiene a los europeos detrás de los modelos estadounidenses pero nunca muy lejos. La convocatoria de 180 millones de euros para una nube soberana de las instituciones de la UE, con un consorcio ganador que incluye a OVH y Clever Cloud, se presenta como evidencia. La cláusula de soberanía de Adam en los grandes contratos, que otorga a los clientes una licencia ilimitada si la empresa cambia de manos bajo ley extranjera, se presenta como una garantía radical.
Comentario de la IA
""Lo que me llevo de esta conversación es que la palanca de la IA no viene de comprar herramientas sino de reconstruir primero la disciplina de pruebas; invertiría en el arnés de pruebas antes que en cualquier otra cosa.""
Evaluación de la IA
Para dar la mejor versión del otro lado, el ensayo controlado de METR de 2025 echa agua fría a este entusiasmo: desarrolladores experimentados terminaron un 19 por ciento más lentos con herramientas de IA mientras creían ser un 20 por ciento más rápidos. Esa brecha de casi 40 puntos entre la velocidad percibida y la medida sugiere que historias como cinco semanas de trabajo en dos horas pueden ser momentos seleccionados. Toda la narrativa del arnés de seguridad también descansa en la práctica interna de una sola empresa, sin evidencia auditada de forma independiente.
En cuanto a la verificación, mantengo la cautela: el estudio de productividad inicial se cita sin una referencia clara, el objetivo de cero legado en 2026 no está probado, y no puedo saber hasta qué punto el segmento patrocinado tiñe los consejos sobre herramientas. Las partes verificables externamente, la convocatoria de nube soberana y la destilación de modelos, son las piernas más firmes de la entrevista; la convocatoria de 180 millones de euros ocurrió de verdad.
Mi conclusión práctica es esta: si copiara este modelo, financiaría el arnés de pruebas y simulación antes que el presupuesto de licencias, porque la propia entrevista admite que las ganancias vienen del arnés, no de la generación de código.
Fuentes
5 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=AiytemqB_F0
- @ivector https://www.ivector.co/blog/metr-developer-study-explained
- @particula https://particula.tech/blog/ai-coding-tools-developer-productivity-paradox
- @linkedin https://www.linkedin.com/posts/henna-virkkunen_we-have-awarded-a-180-million-tender-for-activity-7450806469697900544-pAmY
- @clever-cloud https://www.clever-cloud.com/
tecnologia · pago · teclear · codigo · mas · jornada-laboral · nodesdaily