Una sola escalera va de 32 kilobytes a 640 gigabytes, y la presentadora coloca un aparato real en cada peldaño: un Arduino donde no cabe ningún modelo abajo, ocho H100 a la altura de los modelos frontera arriba. La pregunta es simple: ¿qué tamaño de IA puede ejecutar en casa el hardware de tu bolsillo o tu escritorio?
Chips: mentes en microcontroladores
El primer peldaño es la clase de los microcontroladores , sin sistema operativo, sin sistema de archivos ni memoria extraíble; todo vive en la placa. El Arduino Uno R4 de la presentadora solo tiene 32 kilobytes de RAM y ningún modelo cabe en él. Aun así la placa sirve: por Wi-Fi se convierte en la pantallita de un modelo que corre en una máquina grande del hogar, y en el vídeo aparece en ella un mensaje alegre venido del Mac Studio.
Un peldaño más arriba está el ESP32-S3: 8 megabytes de RAM, unos 20 dólares con pantalla, de dos a cinco sin ella. Ejecuta con holgura dos pequeños modelos de cuentos de la familia TinyStories, de 260 000 y 3 millones de parámetros. La comparativa ESP32 de CircuitDigest, de septiembre de 2026, confirma que un modelo de 260 000 parámetros corre en esta clase. Estos modelos no conversan ni producen audio o imagen; solo generan cuentos breves coherentes, sobre los que se pueden añadir LED que reflejan el ánimo del relato o un pequeño juego de gramática inglesa.
Miniordenadores: misma RAM, distinta velocidad
La clase siguiente son ordenadores de verdad: un Raspberry Pi 5 y el iPhone 16 de la presentadora, ambos con 8 gigabytes de RAM. La demo del Pi impresiona: tres modelos pequeños encadenados, Whisper para voz a texto , Qwen3 1.7B para razonar y Piper para poner voz a la respuesta, o sea una conversación hablada con la placa. Proyectos tipo pi-assistant en GitHub muestran que otros han montado la misma cadena. La presentadora añade una webcam y pide al pequeño modelo visual Moondream que describa la habitación; cuenta bien la mujer de negro, 13 libros desperdigados y la mochila.
Pero el Pi tiene un límite duro: sin GPU . Aunque un pequeño modelo de imagen quepa en memoria, la generación de imagen, música y vídeo queda fuera porque exige cómputo. El Pi lo compensa con sensores y accesorios; la presentadora recuerda que robots de Hugging Face caminan sobre esta placa. Modelos de lenguaje pequeños y medianos, diminutos modelos visuales y modelos de audio: esa es su zona de confort.
Los mismos 8 gigabytes se comportan distinto en el iPhone 16, porque Apple limita cada app a 4-5 gigabytes y deja fuera los modelos medios de 7 a 14 GB que el Pi sí admite. Tampoco se instala nada libremente; todo pasa por apps oficiales: AI Edge Gallery de Google en GitHub sirve la familia Gemma, mientras Draw Things ejecuta Stable Diffusion 1.5 de 2 GB en el teléfono. Los modelos Whisper grandes y todos los de voz a texto van bien, y el modelo de detección YOLO 11N de Ultralytics cuenta objetos por la cámara, la tecnología silenciosa tras el desbloqueo facial y la conducción autónoma. Según la documentación de Ultralytics, YOLO 11 es la serie estable actual, publicada en septiembre de 2024.
La analogía de la cocina: capacidad frente a ancho de banda
La analogía del restaurante, a mitad del vídeo, vuelve intuitivo el hardware: congelador como almacenamiento, mostrador como RAM , cinta transportadora como bus de memoria, chef como CPU, cocineros como GPU, máquinas monotarea atornilladas como NPU. Un modelo se lleva al mostrador de la memoria, viaja por la cinta y se cocina en los procesadores antes de servirse como respuesta. La guía de PromptQuorum de septiembre de 2026 pone números a la intuición: unos 0,6 GB por cada mil millones de parámetros en cuantización de 4 bits, o sea 4-5 GB para 7B, unos 9 GB para 14B y 40 GB para 70B.
La analogía resuelve el enigma Pi frente a iPhone: igual capacidad, distinto ancho de banda. El Pi solo tiene CPU y un bus estrecho y lento, mientras el iPhone combina CPU, GPU y NPU. La generación de imagen, vídeo y música se reparte igual: voraz en cómputo, no pasa con solo CPU. La regla es clara: alojar un modelo es trabajo de capacidad, ejecutarlo rápido es trabajo de ancho de banda y procesadores.
Portátiles y servidores domésticos: la fórmula y la caja 24/7
En la clase de portátiles, el MacBook Pro de 32 GB de la presentadora abre casi todo: grandes modelos de lenguaje, modelos de código, análisis visual, generación de imagen y vídeo, síntesis y reconocimiento de voz, audio y música. En el día a día, Qwen3 14B/16B/32B mueven un agente Hermes, mientras Qwen3 Coder 30B corre en local vía OpenCode; el registro de Ollama lista qwen3-coder 30B con unos 19 GB y 256 000 tokens de contexto. Flux Dev es el favorito para imagen. La presentadora comparte una fórmula práctica de su máquina: restar 25 % de la RAM anunciada, dividir el resto entre 0,6, y el resultado es el techo en miles de millones de parámetros; para 32 GB, 24/0,6 = 40B. Coincide exactamente con el coeficiente 0,6 de PromptQuorum.
Un segmento pertenece al patrocinador Crusoe, presentado como inferencia y ajuste sin servidor para probar modelos abiertos sin faena de clústeres. Ocupa una frase de sustancia y no cambia nada en la escalera.
La clase de servidor doméstico se justifica dos veces: la caja queda encendida, y la capacidad y el ancho de banda suben. El Mac Studio de 64 GB ejecuta grandes modelos de lenguaje y código de 27 a 32B junto a grandes modelos de imagen y música, con generación de vídeo media y lenta. La presentadora guarda allí sus agentes locales y conecta el Arduino. La entrada asequible de la clase, el Mac mini, seguía ilocalizable, de ahí el Studio. Con la fórmula, 64 GB dan 48 útiles y un techo de 80B a 48/0,6, pero ella se queda en la franja de 30B por calidad y velocidad.
El Halo AMD anunciado con 128 GB abre una puerta mayor con unos 96 GB útiles: Llama 3.3 70B y GPT-OSS 120B corren con holgura, con modelos de código muy grandes como DeepSeek Coder V2. Según AMD, las máquinas Strix Halo ejecutan hasta 128B parámetros con LM Studio. El análisis de requisitos de Llama 3.3 70B de VRLA Tech confirma que esa clase pide más que la memoria de una sola tarjeta. Lo que la presentadora más elogia no es un modelo gigante único sino varios modelos cargados a la vez, agente de código, modelo de lengua y generación en paralelo. Su flanco débil es el ancho de banda: termina los trabajos de imagen, vídeo y música despacio.
GPU discretas: ambos mundos a la vez
El final resuelve el ancho de banda con las GPU discretas . En la analogía, cada GPU es un paquete que trae cocineros, mostrador privado y cinta muy ancha, así que cada tarjeta suma procesadores, memoria dedicada y ancho de banda a la vez. La RTX 4090 alquilada es la demo a 24 GB: generación de imagen y vídeo en un parpadeo. Según la guía de packet.ai de julio de 2026, Flux.1 Dev en FP8 pide 18 a 23 GB de memoria y renderiza en 9-10 segundos en una 4090; 24 GB calzan justo a este modelo, los mayores quedan fuera. El Halo AMD y la 4090 se reflejan: alta capacidad con bajo ancho frente a baja capacidad con alto ancho.
En la cima, ocho H100 alquilados: 640 GB de memoria, enorme capacidad y enorme ancho de banda juntos. Aquí se abren modelos de lenguaje sobre 700B parámetros, código sobre 480B, proceso visual y toda generación multimodal, con Minimax produciendo rápido vídeos de minutos. Veredicto de la presentadora: salvo ser una empresa de modelos o tener presupuesto sin fin, este es el final del camino, ya en la liga de los modelos frontera alquilados por API. La lección de la escalera en una frase: calcula primero la memoria útil, luego pesa capacidad contra ancho de banda.
Momentos clave
Comentario de la IA
"La analogía de la cocina aclara como pocas la distinción capacidad-ancho de banda, y la fórmula del coeficiente 0,6 deja a cada espectador capaz de calcular su techo. Pese al segmento patrocinado y a demos elegidas, la lógica de la escalera se sostiene y se verifica con fuentes independientes."
Evaluación de la IA
El contraargumento más fuerte está en la nube: los peldaños altos se facturan por hora o minuto, y para la mayoría bastan unos dólares de API al mes en vez de miles en hardware. Lo local gana en privacidad, uso sin conexión y coste a largo plazo, pero alquilar calidad frontera o alimentar un modelo pequeño en casa depende de la frecuencia de uso y la necesidad de privacidad. La presentadora nunca hace esa cuenta.
Quedan huecos: consumo, calor y ruido ni se mencionan, y ni la tarifa por minuto de los 8 H100, ni la hourly de la 4090, ni los precios del Halo y el Mac Studio se cuantifican. La distinción VRAM frente a memoria unificada, el coste de calidad de los niveles de cuantización y métricas como tokens por segundo quedan fuera de las demos. Lo mostrado es una selección; intentos fallidos, depuración y tiempo de instalación quedan invisibles.
La posición de la oradora merece nota: un segmento lo apoya Crusoe, y ella prueba modelos abiertos para ganarse la vida, con enlaces de guías hacia su ecosistema. No falsifica nada, pero tiñe las elecciones: qué modelos destacan y qué hardware brilla pasan por ese prisma.
El consejo práctico empieza con la fórmula: memoria anunciada menos 25 %, dividida entre 0,6, para hallar el techo, y luego elegir peldaño. Teléfono y Pi para detección, audio y lengua pequeña; portátil para código e imagen; servidor doméstico para agentes 24/7; Halo para 70B y más; GPU alquiladas para generación rápida. Cada peldaño no jubila al anterior; como muestra el Arduino, las placas pequeñas se vuelven las manos pequeñas de las máquinas grandes.
Fuentes
9 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
ia local · hardware · esp32 · raspberry pi · modelos abiertos · gpu