Infoposiciones.net

Portal de empleo, formación y oposiciones

Fecha: 3 octubre, 2025

¿Puede la Inteligencia Artificial competir con profesionales expertos?

OpenAI lanza GDPval, el primer benchmark que evalúa a la IA en tareas laborales reales con valor económico.

GDPval

OpenAI lanza GDPval, el primer benchmark que evalúa a la IA en tareas laborales reales con valor económico.

Más allá de las métricas académicas

Hasta ahora, la mayoría de los estudios sobre inteligencia artificial se habían centrado en pruebas estandarizadas (exámenes académicos, cuestionarios de razonamiento lógico o benchmarks de preguntas y respuestas). Sin embargo, este enfoque deja fuera una cuestión clave: ¿qué ocurre cuando la IA se enfrenta a las mismas tareas que generan valor económico en el mercado laboral real?

Con esta pregunta en mente, OpenAI ha presentado el informe GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks, que propone un cambio de paradigma en la medición de las capacidades de la IA. En lugar de evaluar conocimientos abstractos, este nuevo benchmark mide la capacidad de los modelos para resolver trabajos equivalentes a los que realizan profesionales en sectores que concentran la mayor parte del PIB de EE. UU..

Qué es GDPval y por qué importa

GDPval es un conjunto de tareas diseñadas para evaluar el rendimiento de modelos de IA en trabajos digitales, complejos y económicamente valiosos.

Características principales

  • Cobertura amplia: incluye 44 ocupaciones en 9 sectores estratégicos (finanzas, salud, manufactura, gobierno, retail, información, etc.).
  • Basado en experiencia real: las tareas fueron elaboradas por profesionales con una media de 14 años de trayectoria laboral.
  • Tareas multimodales: abarcan desde informes legales hasta análisis de datos en Excel, diseño en CAD, preparación de presentaciones ejecutivas o edición de vídeo.
  • Valor económico cuantificado: cada tarea está asociada a un coste salarial medio y al tiempo estimado de ejecución (unas 7 horas de trabajo en promedio).
  • Evaluación por expertos humanos: en lugar de métricas automáticas, se comparan entregables de IA y humanos mediante revisiones ciegas por pares profesionales.

En definitiva, GDPval acerca la evaluación de la IA a la realidad del mercado laboral, ofreciendo pistas concretas sobre hasta qué punto puede sustituir, complementar o transformar determinados puestos de trabajo.

Los sectores analizados y sus ocupaciones clave

OpenAI seleccionó los sectores que suponen más del 5% del PIB de EE. UU., incorporando las ocupaciones mejor remuneradas y con mayor contenido digital en cada uno.

Aquí tienes una visión de conjunto:

Sector (peso en el PIB de EE. UU.) Ocupaciones destacadas Hallazgos clave
Inmobiliario y alquiler (13,8%) Gestores inmobiliarios, agentes y corredores de bienes raíces, conserjes IA competente en análisis de datos de mercado y presentaciones, pero limitada en negociación y trato humano.
Manufactura (10,0%) Supervisores de producción, ingenieros industriales y mecánicos, agentes de compras Modelos útiles en diseño y cálculos técnicos; fallos frecuentes en interpretación de planos complejos.
Servicios profesionales, científicos y técnicos (8,1%) Desarrolladores de software, abogados, auditores, gestores de TI, especialistas en proyectos Gran potencial de automatización en programación y documentación; en derecho y contabilidad la IA produce borradores útiles, pero requiere validación humana.
Gobierno (11,3%) Oficiales de cumplimiento, gestores de servicios administrativos, trabajadores sociales, supervisores policiales IA prometedora en informes y análisis de políticas, pero riesgo de errores en tareas con implicaciones legales o sociales.
Sanidad y asistencia social (7,6%) Enfermeras, gestores de servicios médicos, administrativos sanitarios Modelos generan documentación clínica bien estructurada, aunque fallan en matices médicos críticos. Supervisión imprescindible.
Finanzas y seguros (7,4%) Directores financieros, asesores, analistas, agentes de valores, atención al cliente GPT-5 destaca en cálculos y proyecciones; Claude en presentaciones ejecutivas. Riesgo alto en errores de interpretación de datos.
Comercio minorista (6,3%) Directivos de operaciones, supervisores de ventas, farmacéuticos IA útil en previsiones de ventas y gestión de inventarios, pero problemas en contexto local y trato al cliente.
Comercio mayorista (5,8%) Representantes de ventas, directores comerciales, supervisores Buen rendimiento en análisis de mercado y elaboración de informes; fallos en precisión de contratos y logística.
Información y medios (5,4%) Productores, editores, periodistas, técnicos de vídeo y audio Claude sobresale en formatos audiovisuales y presentaciones; modelos aún débiles en creatividad periodística.

Resultados: lo que la IA hace bien (y lo que no)

1. Modelos acercándose al nivel humano

En la muestra “gold” (220 tareas evaluadas en detalle), los mejores modelos de frontera alcanzaron niveles muy próximos a los expertos:

  • Claude Opus 4.1: superior en formato, diseño y estética.
  • GPT-5: sobresaliente en exactitud, cálculos y seguimiento de instrucciones.
  • En conjunto, cerca del 50% de los entregables de IA fueron valorados como iguales o mejores que los de profesionales humanos.

2. Velocidad y ahorro de costes

Simulando escenarios reales de trabajo mixto (IA + supervisión humana), se comprobó que:

  • Los modelos permiten acelerar procesos al reducir horas de trabajo repetitivo.
  • En escenarios de “usar la IA y corregir después”, se obtienen ahorros de entre 1,3 y 1,6 veces en tiempo y costes frente a profesionales trabajando sin asistencia.

3. Fortalezas y debilidades

  • Fortalezas: precisión (GPT-5), estética y formatos (Claude), velocidad.
  • Debilidades: fallos en seguir instrucciones (Gemini y Grok), errores de formato (GPT-5), ocasionales alucinaciones de datos en todos los modelos.
  • La mayoría de los fallos fueron “aceptables pero inferiores”, más que desastrosos. Solo un 3% de los errores de GPT-5 se consideraron catastróficos (con potencial de daño real).

4. Más razonamiento = mejores resultados

Cuando se pidió a los modelos más esfuerzo de razonamiento o se reforzó la estructura de los prompts, la calidad de las respuestas mejoró en hasta 5 puntos porcentuales de preferencia en evaluaciones humanas.

Implicaciones para el empleo y la productividad

Los hallazgos de GDPval refuerzan una idea que ya se observa en el mercado laboral: la IA es más potente como herramienta complementaria que como sustituto directo.

  • Complementariedad: la combinación de IA y supervisión humana permite un equilibrio entre eficiencia y calidad.
  • Transformación de roles: los profesionales deberán centrarse más en tareas de supervisión, contextualización y toma de decisiones.
  • Riesgos latentes: en sectores críticos (salud, finanzas, derecho), un error de la IA puede tener consecuencias graves, lo que obliga a mantener un nivel alto de control humano.

Limitaciones del benchmark

OpenAI advierte que esta es solo una primera versión experimental:

  • Cubre únicamente 44 ocupaciones digitales.
  • No incluye trabajos manuales ni tareas con interacción interpersonal compleja.
  • Las tareas están bien definidas, mientras que en la vida real muchas veces se trabaja con información ambigua o incompleta.

Conclusiones: un anticipo del futuro del trabajo

El estudio GDPval marca un antes y un después en la medición de la IA. Más allá de los exámenes académicos, nos muestra cómo los modelos de frontera comienzan a igualar el rendimiento de expertos en tareas con impacto económico real.

Esto plantea preguntas urgentes para empresas, trabajadores y administraciones públicas:

  • ¿Cómo se redistribuirán las funciones en sectores clave?
  • ¿Qué nuevas competencias deberán adquirir los profesionales para supervisar y complementar a la IA?
  • ¿Deberán los marcos regulatorios adaptarse a una realidad donde las máquinas producen entregables comparables a los de un experto humano?

Una cosa queda clara: la línea entre lo que puede hacer un humano y lo que puede hacer una máquina es cada vez más difusa.

Informe completo de OpenAI: GDPVAL: Evaluating AI Model Performance on Real-World Economically Valuable Tasks (PDF)

✅ Resumen

¿Qué es GDPval de OpenAI?

GDPval es un benchmark diseñado para evaluar la capacidad de los modelos de IA en tareas laborales reales, representativas de ocupaciones y sectores que concentran la mayor parte del PIB de EE. UU.

¿Qué sectores cubre GDPval?

El benchmark incluye 9 sectores: inmobiliario, manufactura, servicios profesionales, gobierno, salud, finanzas, retail, comercio mayorista e información.

¿Qué modelos de IA fueron evaluados?

Se analizaron modelos de frontera como GPT-5, Claude Opus 4.1, Gemini 2.5 Pro y Grok 4. GPT-5 destacó en exactitud y Claude en diseño y formato.

¿Qué resultados obtuvo la IA frente a los expertos?

En el 47% de los casos, los entregables de IA fueron valorados como iguales o mejores que los de profesionales humanos, especialmente en tareas digitales y bien estructuradas.

¿Qué implica GDPval para el mercado laboral?

El estudio sugiere que la IA será más útil como herramienta complementaria que como sustituta total, reforzando la necesidad de profesionales que supervisen, interpreten y contextualicen los resultados.

Temas relacionados: Inteligencia artificial