Inicio / Inteligencia artificial / Un estudio cuestiona que hacer una IA más grande sea siempre la mejor manera de reducir sus alucinaciones

Un estudio cuestiona que hacer una IA más grande sea siempre la mejor manera de reducir sus alucinaciones

Flujo de datos en servidores
  • Los investigadores compararon siete modelos de entre 1.000 y 7.000 millones de parámetros y encontraron diferencias importantes atribuibles a arquitectura, datos y alineamiento.
  • Modelos modernos de 3.000 millones de parámetros llegaron a igualar a otros de 7.000 millones, aunque una cuarta parte de los prompts difíciles hizo fallar a todos.

Aumentar el número de parámetros de un modelo de lenguaje puede mejorar su rendimiento, pero hacerlo más grande no garantiza por sí solo que alucine menos. Un estudio publicado el 23 de agosto en Scientific Reports compara siete modelos de entre 1.000 y 7.000 millones de parámetros y concluye que decisiones de arquitectura, calidad de los datos y técnicas de alineamiento explican aproximadamente una cuarta parte de la variación observada entre sus resultados.

La comparación resulta relevante porque buena parte de la carrera reciente de la inteligencia artificial se ha asociado con aumentar la escala. El trabajo encuentra, sin embargo, que modelos modernos de unos 3.000 millones de parámetros pueden alcanzar niveles similares a modelos anteriores de 7.000 millones cuando incorporan diseños y procesos de entrenamiento más eficientes. Según los autores, esa mejora puede equivaler en determinados escenarios a duplicar el tamaño utilizando aproximadamente la mitad de los parámetros.

¿Quieres seguir toda la actualidad tecnológica? Añade Complubits como fuente preferida en Google para encontrar nuestras noticias más fácilmente. Añadir como fuente preferida

Eso no significa que los modelos pequeños sean siempre mejores ni que la escala haya dejado de aportar ventajas. Los investigadores detectan rendimientos decrecientes a medida que aumenta el tamaño dentro del conjunto heterogéneo evaluado, pero la comparación combina familias diferentes y no constituye una prueba controlada en la que todos los modelos sean idénticos salvo por su número de parámetros. Arquitectura, datos y procedimientos de entrenamiento cambian simultáneamente entre sistemas.

El estudio encuentra además un límite que ni tamaño ni diseño consiguieron resolver. Aproximadamente una cuarta parte de los prompts construidos para ser especialmente exigentes provocó fallos en todos los modelos analizados. Las tareas que requerían razonamiento en varios pasos y seguimiento temporal aparecieron entre las más problemáticas, lo que apunta a limitaciones compartidas que no desaparecieron simplemente utilizando más capacidad computacional.

La conclusión práctica es que evaluar un modelo únicamente mediante el número de parámetros puede resultar engañoso. Dos sistemas de escalas muy diferentes pueden presentar niveles similares de fiabilidad si el más pequeño utiliza una arquitectura y entrenamiento más recientes, mientras un modelo grande puede continuar fallando ante determinadas clases de pregunta. Esto afecta tanto a costes de infraestructura como a la posibilidad de ejecutar modelos eficientes en dispositivos o servidores menos potentes.

El trabajo tampoco establece una receta universal para eliminar alucinaciones. Se limita a demostrar que la escala explica solo una parte del comportamiento y que existe margen importante de mejora mediante diseño. La siguiente prueba será comprobar si este patrón se mantiene en modelos mucho mayores, familias cerradas de última generación y tareas reales más variadas que las utilizadas dentro del estudio.

Deje un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *