Vea También
Cada semana, un nuevo modelo de IA generativa supera al anterior en algún ranking. Las grandes tecnológicas compiten por décimas y anuncian récords. Esa competencia es real: los modelos difieren en velocidad, en precio y en qué examen aprueban con mejor nota.
La pregunta que casi nadie se hace es otra: ante una misma instrucción –sobre todo, cuando les pedimos algo que no tiene una respuesta clara–, ¿piensan distinto? Después de haberlo medido en un estudio, la respuesta corta es que no, o muy poco.
Dieciséis modelos, un mismo caso
Reunimos dieciséis grandes modelos de lenguaje de diez empresas distintas: OpenAI, Anthropic, Google, xAI, Meta, DeepSeek, Mistral, Alibaba y otras dos compañías chinas, Z.ai y MiniMax Group. A todos les dimos los mismos quince casos clínicos de salud mental, descritos por una psicoterapeuta específicamente para este estudio.
Cada modelo, a solas y sin ver lo que hacía el resto, redactó la valoración propia de un supervisor clínico experimentado: desde qué enfoque interpretaban el caso y qué habría que explorar.
Elegimos la psicología a propósito, ya que formular un caso en psicoterapia no tiene una respuesta única. La misma historia admite varias interpretaciones defendibles y elegir entre ellas es cuestión de criterio, no de acierto. Si dieciséis modelos iban a discrepar en algún sitio, tenía que ser ahí.
A continuación, recogimos más de 7 000 respuestas generadas por los modelos y las comparamos por su significado, no por sus palabras, con un índice que respondía a una pregunta sencilla: ¿a cuántas opiniones realmente distintas equivale este conjunto de textos? Dieciséis textos idénticos valen una, y dieciséis sin nada en común, dieciséis. El estudio quedó registrado públicamente antes de generar un solo dato, y el código y los resultados son abiertos.
Menos de dos voces
El promedio fue de 1,69 opiniones distintas. Es decir, las respuestas de dieciséis modelos distintos equivalían a menos de dos opiniones. Esta cifra resulta más llamativa todavía si tenemos en cuenta que un solo modelo, leyendo el mismo caso dieciséis veces, ya produce por su cuenta el equivalente a 1,43 opiniones.
La explicación no es misteriosa ni compleja. Estos modelos compiten con ingredientes muy similares: se entrenan con textos que se solapan y se ajustan con objetivos parecidos. No decimos que todos sean igual de buenos ni que escriban lo mismo, sino que, aunque cada uno lo cuente a su manera, las conclusiones que sacan son las mismas.
El comité que no es comité
Esto importa porque ya funcionan sistemas construidos sobre esa idea. Microsoft presentó, en 2025, un orquestador diagnóstico que describe como un panel virtual de médicos con enfoques diversos, mientras que otros proveedores venden esa misma arquitectura como una plantilla lista para cualquier aplicación. No hemos evaluado esos productos, ni los hemos probado en tareas con una única respuesta correcta, cuya coincidencia puede medirse contra el acierto. Cuando no hay contestación acertada, la única garantía que ofrece el panel es que sus miembros piensen distinto. Y eso es lo que no ocurrió.
El Reglamento de Inteligencia Artificial europeo exige que, en los sistemas de alto riesgo, como los de salud, una persona supervise de verdad sus decisiones. Pero nadie puede revisar miles de decisiones a la hora, así que necesita una regla para saber cuándo mirar: la más natural es hacerlo si los modelos no se ponen de acuerdo.
Esa regla casi nunca se activa. No porque el sistema acierte, sino porque los modelos casi siempre coinciden. Y no lo hacen como expertos llegando por separado a la misma conclusión, sino como expertos formados en la misma escuela, con los mismos libros. La calma que transmiten al supervisor no está ganada.
Cuando la herramienta confirma en lugar de contrastar
Queda por saber cómo influyen las respuestas de ese coro de expertos cantando al unísono en la persona que las recibe. En 2025, la revista The Lancet Gastroenterology and Hepatology publicó el seguimiento de diecinueve endoscopistas veteranos que llevaban meses trabajando con ayuda de la IA. Cuando la apagaban, su tasa de detección de lesiones bajaba del 28,4 % al 22,4 %. La herramienta no les quitó el trabajo; les quitó la vigilancia.
Con la IA generativa, el patrón se repite. Una encuesta de Microsoft y la Universidad Carnegie Mellon a 300 profesionales encontró que, cuanto más confiaban en la herramienta, menos pensamiento crítico decían ejercer.
Nuestro resultado añade una razón más para preocuparse. Una segunda opinión es útil porque puede llevarnos la contraria, plantear retos y mantenernos activo mentalmente. Dieciséis opiniones que coinciden no llevan a la autocrítica, al pensamiento lateral, ni a la duda; solo confirman. Y quien solo recibe confirmación deja de ejercitar justo lo que pide el citado reglamento europeo: tener criterio para decir que no. De todos modos, lo hemos comprobado en un solo dominio –salud mental– y en español, lo cual obliga a tomar los resultados con prudencia.
Preguntar a muchos modelos solo sirve si alguno puede decir que no. Y cuando la segunda opinión es la primera repetida, lo que está en juego no es lo que saben las máquinas, sino lo que dejamos de saber nosotros. Los modelos seguirán peleando por llegar a ser distintos. Nosotros, mientras tanto, debemos pelear por seguir siéndolo.
Mario Vega Barbas no recibe salario, ni ejerce labores de consultoría, ni posee acciones, ni recibe financiación de ninguna compañía u organización que pueda obtener beneficio de este artículo, y ha declarado carecer de vínculos relevantes más allá del cargo académico citado.