Ir al contenido
Español
Contenido de FikirPilot

Ejecutar AI generativa en RP2350

Actualizado: 05/09/2026 · 2 min de lectura · 308 palabras

Publicado: · Noticia recibida: · Tiempo de procesamiento: 6 h 5 min

Ejecutar AI generativa en RP2350
Placa de circuito electrónico sobre una mesa de madera

La búsqueda de privacidad, personalización y bajos costes está aumentando el interés por los modelos de inteligencia artificial que pueden ejecutarse en hardware local. [Tim] desarrolló un modelo de generación de imágenes capaz de funcionar en el microcontrolador RP2350. El sistema de la placa de desarrollo Waveshare RP2350 solo genera rostros humanos; la resolución es de 128×128 y el tiempo por imagen es de aproximadamente veinte segundos. El resultado puede obtenerse a través de USB o visualizarse mediante una placa adaptadora VGA. En lugar de crear la imagen directamente, el modelo genera una distribución en el espacio latente; el decodificador del autoencoder variacional la convierte en una imagen. El transformador de difusión de flujo latente crea la imagen paso a paso, comenzando a partir del ruido. [Tim] cuantizó con enteros de 8 bits dos modelos, uno más grande y otro más rápido; ambos y el programa de inferencia caben en una memoria flash de 4 MB.

Por qué es importante

Este trabajo demuestra que la generación de imágenes no depende únicamente de tarjetas gráficas potentes o servidores remotos, sino que también puede llevarse a cabo dentro de un alcance determinado en microcontroladores con recursos limitados. El procesamiento en el dispositivo puede interesar a los usuarios que buscan privacidad y desean trabajar sin depender de una conexión, ya que no es necesario enviar a la nube las imágenes de rostros generadas. Los reducidos requisitos de memoria y almacenamiento indican que se ha logrado superar un límite técnico a la hora de adaptar el modelo a hardware pequeño e integrado. Sin embargo, el hecho de que el sistema solo genere rostros, mantenga una resolución baja y necesite aproximadamente veinte segundos por imagen limita su ámbito de uso. Por ello, la cuestión abierta es si un enfoque similar puede trasladarse a contenidos más diversos y a tiempos de generación más cortos.

Fuente: Hackaday