Volver al inicio

No es una herramienta de codificación, sino un tiempo de ejecución de agentes: Ejecute su propia capa de agentes con TrueForge

NeuralNine demuestra TrueForge, el arnés de agente de código abierto con licencia MIT de TrueFoundry, como una capa de tiempo de ejecución neutral para el proveedor y una alternativa a los agentes gestionados de Claude. El recorrido cubre la idea del bucle de agente, un benchmark de costos de 14 tareas, configuración local, chats de prueba, un asistente de acciones API de Python, un agente de informes de sandbox de Daytona, habilidades y modelos locales.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — lcMf0W0cxig
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

NeuralNine enmarca TrueForge desde el primer minuto como infraestructura, no como otro asistente de codificación junto a Pi u OpenCode. El producto es un arnés con licencia MIT de TrueFoundry que proporciona la capa de tiempo de ejecución para agentes de propósito general. Encuentro el encuadre útil porque establece la expectativa correcta: esta es la columna vertebral de un sistema de agentes, no una ventana de chat.

El video luego explica lo que realmente cubre un arnés, y creo que estos son sus mejores dos minutos. Un modelo de lenguaje por sí solo solo mapea tokens de entrada a tokens de salida, mientras que un agente también necesita llamadas a herramientas, conexiones MCP, sandboxes de código, aprobaciones de un humano y estados de espera. TrueForge posee ese bucle circundante: razonar, actuar, leer resultados y continuar hasta que el trabajo esté hecho. Una vez que se ve el bucle como el producto, la comparación con los agentes gestionados de Claude comienza a tener sentido.

Antes de la demostración, el presentador pone una divulgación sobre la mesa: el video es una colaboración pagada con TrueForge, aunque las opiniones son suyas. Acredito esa apertura, y es importante para todo lo que sigue porque las afirmaciones de costos provienen del proveedor. La invitación es a probar todo lo que se muestra de forma gratuita y a marcar el repositorio con una estrella, para que al menos el espectador pueda verificar lo básico sin pagar.

El benchmark proviene de una publicación de X y cubre 14 tareas de Enterprise-Bench de DevRev, que abarcan registros de CRM, rastreadores de problemas y almacenes de documentos. Se comparan tres configuraciones: agentes gestionados de Claude con Opus 4.8, TrueForge con el mismo Opus 4.8 y TrueForge con el modelo abierto GLM-5.2. La finalización reportada es de 11 de 14 en cada ejecución comparable, con un costo por tarea de 11.80 dólares gestionados, 8.50 dólares en TrueForge con el mismo modelo y 2.90 dólares con el modelo abierto. Eso es aproximadamente un 30 por ciento más barato en modelos iguales y un 75 por ciento más barato con el modelo abierto.

TrueFoundry en sí misma merece una frase de contexto. Es una empresa de infraestructura de aprendizaje automático de San Francisco fundada en 2021 por ex ingenieros de Meta, y ya vende a empresas una pasarela de pago para el acceso a modelos, credenciales y presupuestos. TrueForge se sitúa por encima de esa pasarela como el bucle de ejecución abierto, lo que explica la lógica comercial: regalar el arnés, mantener el plano de control. Forbes describe la misma división, con el titular de un ahorro del 50 por ciento que necesita matización.

La instalación es deliberadamente aburrida, lo que digo como un elogio. Copias un comando NPX del repositorio de GitHub, lo ejecutas una vez y descarga el paquete, crea una base de datos SQLite local y sirve una página en localhost. La vista del navegador que se abre es tu panel de control, y desde allí adjuntas los modelos que desees. Un inicio local como este reduce la barrera de prueba a casi cero.

La configuración del modelo cubre a los grandes proveedores más una salida autoalojada. Puedes pegar una clave de OpenAI, hacer lo mismo para Anthropic o Gemini, o registrar un proveedor personalizado con una URL base que apunte a Ollama. El video muestra la creación de claves en la consola del proveedor y luego muestra los modelos apareciendo dentro de TrueForge. Esa estantería neutral para el proveedor, incluidos los modelos locales, es la promesa central de todo el proyecto.

La vista de chat que te recibe es explícitamente un laboratorio, no el producto. Abres un nuevo chat, activas conectores como Linear, Notion o la búsqueda web de Exa, y experimentas con prompts antes de que algo sea permanente. Un botón de guardar visible marca el límite entre jugar y enviar. Me gusta esta separación porque te obliga a probar que la configuración funciona antes de nombrarla y exponerla.

El primer ejemplo completo construye un asistente de investigación de acciones. Un prompt de prueba desechable solicita los datos financieros de Nvidia, el agente se ramifica en llamadas a herramientas y un subagente, y visiblemente busca en archivos tipo 10-Q y 10-K antes de resumir. Luego viene la lección clave: nada de ese historial de chat se convierte en el agente. La definición guardada es un prompt de sistema corto más el modelo, los conectores y las habilidades elegidos, después de lo cual una entrada MSFT desnuda produce un nuevo resumen de Microsoft.

La sección de beneficios traslada al agente del navegador a Python. No hay un SDK de Python, solo uno de TypeScript, por lo que la demostración utiliza solicitudes simples contra la API local: abrir una sesión con el nombre del agente, mantener el ID de sesión devuelto, publicar un mensaje de usuario y leer un flujo de eventos enviados por el servidor. El script filtra el flujo en busca de deltas de mensajes del modelo y los imprime en vivo, y una consulta de Tesla devuelve hallazgos transmitidos mientras el panel muestra cada paso del agente. Un programa corto como este convierte el arnés en una verdadera capa de tiempo de ejecución para sus propias aplicaciones.

El segundo agente eleva las apuestas con un sandbox de código Daytona. Después de crear una clave API de acceso completo y pegarla en la configuración del sandbox, el agente puede ejecutar Python en lugar de simplemente describir números. Al pedirle los datos financieros de Meta en formato PDF con gráficos de Matplotlib, busca en la web, ejecuta el código de forma remota y devuelve un informe descargable con gráficos generados. Guardar esto como un segundo agente con gráficos incorporados en sus instrucciones hace que cada ticker posterior, como Nvidia, siga automáticamente el mismo proceso.

Las habilidades obtienen su propia demostración compacta a través del arte algorítmico. Sin ninguna habilidad adjunta, una solicitud creativa produce un archivo SVG o HTML simple; con la habilidad dedicada habilitada, el agente primero lee las instrucciones de la habilidad y produce una pieza visiblemente más profesional con parámetros ajustables. El contraste es el argumento completo para las habilidades en miniatura: el conocimiento empaquetado supera la generación bruta. Las habilidades importables desde GitHub más los servidores MCP personalizados son lo que convierte la trivial demostración de búsqueda web en algo propietario.

El tramo final vuelve a la neutralidad del proveedor con modelos locales. Una entrada de proveedor personalizada dirigida a la URL base estándar de Ollama, un ID de modelo ingresado manualmente de la familia Qwen con alrededor de 27 mil millones de parámetros, y límites de contexto y salida pegados son suficientes para integrar una máquina doméstica en el mismo flujo de trabajo. El presentador lo ejecuta desde el hardware de su propia estación de trabajo y obtiene respuestas a través del mismo bucle que anteriormente sirvió al modelo de OpenAI. Todo abierto, todo propio: esa es la nota con la que termina el video, junto a un recordatorio de que el proyecto vive o muere por las estrellas de la comunidad.

Visualization: nodesdaily AI

Comentario de la IA

"“Veo TrueForge como infraestructura más que como otro envoltorio de chatbot, y esa distinción es exactamente la razón por la que encuentro que este video vale la pena cubrirlo.”"

Evaluación de la IA

La objeción más fuerte es que un servicio gestionado existe precisamente para que los equipos no tengan que cuidar la infraestructura, y para un equipo pequeño, la opción alojada puede seguir siendo la elección racional. Ejecutar su propio bucle significa ser propietario de las actualizaciones, la rotación de credenciales, la higiene del sandbox y la respuesta a incidentes, y esas horas rara vez aparecen en un gráfico de referencia. Yo defendería el otro lado así: el ahorro del 30 por ciento le compra un segundo trabajo como su propio equipo de plataforma.

Lo que la demostración no prueba es el lado adverso del autoalojamiento. Un informe de seguridad de Microsoft sobre tiempos de ejecución autoalojados advierte que las habilidades descargadas y las entradas de texto no confiables convergen en un único bucle de ejecución, por lo que una implementación desprotegida conlleva el riesgo de exposición de credenciales, memoria envenenada y compromiso del host. El video conecta conectores de terceros, servidores MCP personalizados y habilidades descargadas sin discutir el alcance o el aislamiento, y el segmento del sandbox cubre la ejecución de código sin cubrir los límites de las credenciales. Esa brecha importa más que cualquier característica faltante.

Sobre la procedencia, dos cosas necesitan ser aclaradas. El video está pagado por TrueForge, lo que el presentador revela abiertamente, y las cifras principales provienen del propio blog del proveedor en lugar de una repetición independiente. Las cifras por tarea de 2.90, 8.50 y 11.80 dólares son verificadas por los informes de VentureBeat, pero la reproducibilidad exacta en el Enterprise-Bench de DevRev requeriría una nueva ejecución con prompts y versiones de herramientas fijadas. Trato la dirección como creíble y los decimales como proporcionados por el proveedor.

Mi lectura práctica es que TrueForge se adapta a los constructores que ya operan infraestructura y desean libertad de modelo, ejecución local y bucles auditables. Si solo necesita un asistente con búsqueda web, esto es excesivo y un servicio gestionado le servirá más rápido. Yo comenzaría con la instalación local, conectaría una herramienta interna real a través de una credencial con alcance, y solo entonces decidiría si los ahorros sobreviven al contacto con su propia carga de operaciones.

Fuentes

9 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

trueforge · arnés de agente · código abierto · claude · truefoundry · daytona · ollama

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…