CARGANDO INFORMACIÓN...

Del test de Turing a la etiqueta nutricional: tres novedosos enfoques para medir la inteligencia de las máquinas

Un artículo en la revista ‘Science’ sugiere respuestas innovadoras para comprobar su impacto en la cognición humana a la hora de comparar modelos de IA

Los modelos de lenguaje han convertido la inteligencia artificial (IA) en algo cotidiano. Cada vez hay más y hacen más cosas. Es más difícil averiguar cuál funciona mejor para según qué tareas. Un nuevo artículo en la revista Science de científicos de Princeton, el MIT, Cambridge y Google DeepMind sugiere nuevas maneras de medir las mejores IA, dejando atrás el viejo test de Turing y los recientes rankings: “La respuesta a la pregunta original de Turing [¿puede una máquina pasar por un humano?] ya se ha contestado, en afirmativo”, dice José Hernández-Orallo, autor principal del artículo, director de investigación del Centro Leverhulme de la Universidad de Cambridge y catedrático de la Universidad Politécnica de Valencia. “Y la evaluación basada en hitos [benchmarks] convierte la IA en una carrera para maximizar indicadores”.

Estas maneras de medir comparan sobre todo la IA con un humano: si piensa, si es capaz de aprobar un examen, si es capaz de programar una web. El artículo propone adoptar tres formas nuevas de evaluarla, cambiando preguntas mal formuladas: ¿puede la IA superar al ser humano?, ¿puede sustituirlo?, ¿podemos alinearla con valores humanos? Cada una se cambia por un eje con más opciones: midiendo su diversidad con algo similar al panel nutricional de un yogur, viendo cómo afecta a la cognición humana y observando su impacto en la sociedad.

Hernández-Orallo compara la pregunta sobre la inteligencia con otra sobre volar: está claro que las máquinas pueden volar. “Pero la mayoría de aeronaves no se parecen a los pájaros, ni nos importa”, dice. “Tampoco marca la agenda el avión más rápido o el más ligero. Esos indicadores están bien como reto, pero no para evaluar. Hemos de medir la gran diversidad de maneras de volar, qué experiencia los humanos sienten en cada una de ellas y cómo lo hacen de la manera más segura y sostenible para la sociedad”, explica.

Para eso han dividido las preguntas en tres bloques. El primero es dejar de medir en una sola escala y trocear el carácter de cada sistema de IA. Usan la biología como ejemplo. Cada especie animal tiene su lugar, con sus fuerzas y sus limitaciones. Con la IA pasaría lo mismo: en vez de preguntar si un sistema es mejor o peor que una persona, debería describirse en qué es bueno, malo y en qué tareas encaja. Cada sistema tendría una especie de ficha. En el artículo ponen de ejemplo un programa competente en finanzas pero incapaz de reconocer una declaración de impuestos inventada. 

“Cualquier usuario suele crearse ciertos modelos mentales como ‘GPT Sol es más cabezota que Claude Fable’. Podemos construir sobre esa psicología popular y crear perfiles basados en rasgos que la gente entienda, pero al mismo tiempo se basen en mediciones científicas. Deberíamos poder advertir a reguladores y empresas que ‘el agente A tiene niveles bajos de planificación y es poco escrupuloso en su cometido, con lo que quizá falle en proyectos largos’. Para el público en general sí podemos utilizar etiquetas más sencillas como la información nutricional, igual que un manual de instrucciones de un automóvil o lavadora”, explica Hernández-Orallo.

En otras noticias:

error: Content is protected !!