¿Qué revela el benchmark GDPval sobre la IA?
El estudio GDPval analiza el rendimiento de diferentes modelos de inteligencia artificial frente a expertos humanos en tareas profesionales complejas. Los resultados son claros: la IA ya no está tan lejos de nosotros. De hecho, el modelo Claude Opus 4.1 alcanzó una tasa de preferencia o equivalencia frente a humanos del 47,6%, lo que significa que, en casi la mitad de los casos, los evaluadores consideraron sus resultados al mismo nivel que los de un profesional.
¿La mejora de la IA es constante?
Sí. Los modelos de OpenAI muestran una mejora lineal con el tiempo, lo que indica que, a medida que avanza la tecnología, el salto de calidad no es puntual, sino sostenido. Esto hace pensar que en pocos años la paridad con los humanos será una realidad en más tareas de alto valor.
¿En qué destacan los diferentes modelos?
Cada modelo tiene sus puntos fuertes:
- Claude Opus 4.1: brilla en tareas relacionadas con la estética, como el diseño de diapositivas o la maquetación de documentos.
- GPT-5: sobresale en precisión, especialmente en el seguimiento de instrucciones y cálculos.
- Gemini y Grok: presentan más problemas, sobre todo al prometer resultados que luego no cumplen o al ignorar datos clave.
Este reparto de fortalezas sugiere que no existe un único modelo perfecto, sino que la especialización marcará la diferencia según el tipo de tarea.
¿Puede la IA ahorrar tiempo y dinero?
Una de las conclusiones más interesantes es el potencial de ahorro que ofrece integrar la IA en los flujos de trabajo. El esquema más eficiente fue aquel en el que el experto recurre primero a la IA, y si la respuesta no convence, realiza él mismo la tarea.
En este escenario, GPT-5 mostró una mejora de velocidad de 1,39x y de coste de 1,63x. No es magia: simplemente, combinar la rapidez de la IA con la experiencia humana multiplica la productividad.
¿Dónde siguen fallando los modelos de IA?
El principal problema detectado es no seguir instrucciones al pie de la letra. Aunque GPT-5 fue el que menos errores cometió en este aspecto, sigue siendo una limitación clave.
Otros fallos frecuentes incluyen:
- Errores de formato en GPT-5.
- Inconsistencias en Claude, Grok y Gemini al ejecutar lo que se les pide.
- Resultados prometidos que no llegan en Gemini y Grok.
Estos detalles muestran que, aunque el avance es enorme, aún queda recorrido para alcanzar un nivel de fiabilidad plena.
¿Cómo mejorar el rendimiento de la IA?
El estudio señala dos caminos principales para exprimir al máximo estos modelos:
- Incrementar el esfuerzo de razonamiento: dar más margen de procesamiento a los modelos mejora sus resultados en tareas complejas.
- Optimizar el prompting: la calidad de las instrucciones es determinante. Un buen prompt puede reducir errores graves. De hecho, con mejores instrucciones, GPT-5 consiguió eliminar artefactos en PDFs y reducir fallos de formato en un 22%.
¿Y en un caso concreto como la traducción?
En septiembre de 2026 Marcus Pentzek publicó en Search Engine Journal un benchmark de localización de inglés a chino con 774 textos evaluados a ciegas por localizadores nativos. Lo interesante es que el resultado depende mucho del tipo de contenido:
- Los humanos ganaron en contenido informativo y SEO, donde mandan la precisión y la terminología. Aun así, en SEO solo superaron en 2,8 puntos al mejor flujo con IA (Qwen o Doubao con posedición humana), una diferencia pequeña.
- En marketing, interfaces, contenido técnico y redes sociales quedaron fuera del top 5. En marketing fueron décimos de 15, a 22,2 puntos del mejor flujo. Los autores creen que el traductor tiende a pulir el texto hacia un registro demasiado formal.
- Elegir bien el modelo importó más que la posedición. Dentro de los modelos chinos, la diferencia entre el mejor y el peor llegó a 22,3 puntos en contenido técnico, mientras que la posedición mejoró la calidad una media de 5,6 puntos. En algunos casos (ChatGPT y Kimi en marketing) la revisión humana incluso empeoró el resultado.
Hay que leerlo con cuidado: el estudio lo hacen dos empresas que venden servicios de localización, mide calidad lingüística y no posicionamiento, y usa versiones de los modelos de diciembre de 2025, que ya se han quedado antiguas. Aun así, refuerza lo que decía antes: no hay un ganador absoluto, depende de la tarea. Y refuerza otra idea, que es probar con tu propio contenido antes de decidir.
¿Se nota ya esa productividad en las empresas?
Un benchmark mide qué puede hacer la IA, no lo que consigue una empresa al usarla. Greg Jarboe recoge en Search Engine Journal una encuesta citada por MIT Technology Review a unos 6.000 directivos de cuatro países: alrededor del 90 % decía no haber visto mejoras de productividad por la IA en tres años. Otros datos que cita apuntan en la misma dirección: según Workday, por cada 10 horas que ahorra la IA se pierden unas cuatro corrigiendo resultados flojos, y un estudio de BetterUp Labs y Stanford encontró que el 41 % de los trabajadores había recibido en el último mes contenido de IA de baja calidad (workslop) que costaba casi dos horas arreglar.
Esto encaja con el esquema que mostraba GDPval: la IA primero y el experto después solo ahorra tiempo si la primera respuesta es lo bastante buena. Si no, el ahorro desaparece en la revisión. Por eso conviene apuntar las horas a ambos lados: las que se ahorran y las que se dedican a revisar y corregir.
¿Qué podemos concluir?
Los modelos de IA de última generación están cada vez más cerca del nivel humano en tareas con valor económico real. Su rendimiento mejora de forma constante y, con las instrucciones adecuadas, pueden ser todavía más precisos.
La clave no está en elegir entre humanos o máquinas, sino en aprender a combinar lo mejor de ambos mundos. La IA aporta velocidad y reducción de costes; los profesionales, criterio y fiabilidad. Y esa mezcla es la que está redefiniendo el futuro del trabajo.
Ojo, que rendimiento en un benchmark no es lo mismo que autonomía real: los agentes de IA que encadenan varias de estas tareas siguen arrastrando errores acumulativos que no siempre se ven en pruebas aisladas.