Modelos de IA más pequeños superan a los más grandes en eficiencia, encuentra estudio de Google

- Modelos de IA más pequeños superan a los más grandes en generación de imágenes, redefiniendo la eficiencia.
- En IA, más grande no siempre es mejor: lo demuestra un estudio de Google y Johns Hopkins.
- Revolucionando la IA: los modelos más pequeños allanan el camino para una tecnología accesible y eficiente.
En medio de todos los estudios que han intentado sistematizar el campo de la inteligencia artificial (IA) y han lidiado con la pregunta de si existe un punto en el que los modelos de IA más pequeños puedan superar a los más grandes en eficacia, el estudio de Google Research y la Universidad Johns Hopkins finalmente ha desmentido ese argumento. Ha demostrado que, en el contexto de la generación de imágenes, los modelos más pequeños tienden a funcionar mejor que sus contrapartes más grandes. El 2 de mayo, el estudio dirigido por Kangfu Mei y Zhengzhong Tu reveló las propiedades de escalado de los modelos de difusión latente (LDM). Descubrieron que los cambios en la resolución de la imagen de salida no traen alteraciones significativas, sin embargo, aumentar el tamaño del modelo puede conducir a mejoras sustanciales.
Repensando la eficiencia de los modelos de IA
Los estudios emplearon LDMs de 39 millones a 5 mil millones de parámetros con variedades para tareas que incluyen la generación de texto a imagen, super-resolución y super-resolución dirigida por sujeto, mientras los participantes se sometían a procesos de entrenamiento y evaluación cuidadosamente practicados y evaluados. El hecho probado de que los modelos más pequeños se mantienen firmes, incluso si no son más grandes que los comparados, muestra que cuando el cómputo es limitado, los modelos más pequeños incluso pueden exceder a los modelos más grandes.
Las exploraciones realizadas por este estudio se encuentran intrincadas. El primer punto digno de mención es que los modelos pequeños son de alto rendimiento y ofrecen la misma o mayor eficiencia de muestreo en todos los tipos de muestreadores de difusión e incluso después de que se realiza la destilación del modelo.
Esta robustez explica así que la escala del chip de los modelos inferiores es integral a sus méritos y no es una consecuencia directa de un algoritmo o método de entrenamiento. Sin embargo, también admite que los modelos más grandes pueden ser útiles para el mismo propósito, especialmente en casos donde no surgen problemas de asignación de recursos (como la potencia de cómputo), ya que pueden crear imágenes con mejores detalles.
Hallazgos clave e implicaciones
Tales descubrimientos no solo son revolucionarios para el espacio tecnológico actual, sino que también tienen consecuencias significativas para el desarrollo de la IA. Desempeñan una función significativa como guía para el desarrollo de sistemas de IA, permitiendo una generación de imágenes más accesible, potente y amigable con los recursos en capacidades de alto nivel. Esto es especialmente importante en una época en la que ha habido un llamado creciente para el desarrollo de la inteligencia artificial con apertura y accesibilidad, de manera que llegue a los desarrolladores y, en última instancia, a los usuarios.
Está en línea con una cierta tendencia de la sociedad de la IA que prevalece hoy en día y esto proporciona evidencia de la superioridad de modelos más pequeños como LLaMa y Falcon en comparación con el resto bajo varias tareas.
La tendencia a aplicar códigos de código abierto, que son eficientes en términos de velocidad y ahorro de energía del dispositivo, aumentará el nivel de democracia en el mundo de la IA al permitir que el sistema funcione sin la demanda de sensibilidad de sistemas informáticos avanzados. Las ramificaciones de este tipo de estudio son bastante impactantes, lo que puede llevar a un cambio completo en la forma en que la IA se aplica a las tecnologías del día a día y hacer que las soluciones de IA de alto nivel estén disponibles para usuarios adicionales.
Un cambio de paradigma
Los estudios de investigación de Google Research y la Universidad Johns Hopkins han creado ahora un punto crítico en el desarrollo de la IA, ya que cuestionan los enfoques actuales de desarrollo de IA y guían a los profesionales para implementar procesos de IA más baratos y respetuosos con el medio ambiente.
La comunidad de IA avanza hacia el área de investigación de modelos minúsculos; esta investigación no solo resume todo el entendimiento actual de la perspectiva, sino que también proporciona espacio para innovaciones creativas respecto a la eficiencia, el rendimiento y la practicidad de la creación de sistemas de IA.
Este desarrollo es, por tanto, no solo un cambio de paradigma en el desarrollo de la tecnología de IA, sino también un movimiento de la industria hacia la inclusión y la accesibilidad en la tecnología. Entre las cosas que la creciente presencia de la IA está haciendo, desplegar modelos desplegables en una miríada de dispositivos que pueden funcionar de manera eficiente y precisa es una de las pocas cosas que pueden hacer que la IA tenga un rango de aplicaciones mucho más amplio una vez que estas cosas lleguen al mercado.
La novedad de este estudio entra en juego mediante las propiedades de escalado del modelo que incorporan los compromisos entre el tamaño del modelo y el rendimiento, lo que los convierte en una investigación innovadora que promete un futuro de IA más eficiente y accesible.
Si estás leyendo esto, ya vas por delante. Mantente así con nuestro boletín.

John Palmer
John Murangiri llegó a Cryptopolitan con habilidades en análisis de mercado. John (también conocido como JP) se graduó de la Universidad de Nairobi con un título de licenciatura en comunicación masiva y estudios de medios. Anteriormente, ha contribuido con perspectivas del mercado de criptomonedas a InsideBitcoins.com y Metacoingraph.















