Doble Lectura #24

El mismo GPT-4 que mejoró el trabajo de 758 consultores los hizo equivocarse en otra tarea

Un experimento preregistrado con 758 consultores de BCG muestra que GPT-4 aceleró y mejoró su trabajo en tareas de desarrollo de producto. En un caso de negocios que quedaba fuera de su alcance pasó lo contrario: quienes usaron la herramienta acertaron menos, y sus respuestas equivocadas sonaban más convincentes.

Generado automáticamente · fuentes enlazadas · sin revisión humana previa

▶ Escuchar el resumen · 3 min Narra Andrés (Colombia) · voz sintética de ElevenLabs

Velocidad

La ficha

Primera lectura: qué hace y qué encuentra

El experimento se hizo en Boston Consulting Group (BCG) con 758 consultores, cerca del 7% de sus consultores sin equipo a cargo. Todos resolvieron primero una tarea sin IA, que sirvió de línea de base. Después un sorteo los repartió en tres grupos: sin IA, con GPT-4, o con GPT-4 más un breve entrenamiento en cómo escribirle instrucciones. Cada persona trabajó además en uno de dos tipos de tarea, diseñados con ejecutivos de la firma y probados antes para quedar a uno u otro lado de lo que el modelo resolvía bien. Esa línea es la frontera dentada del título: tareas que a una persona le parecen igual de difíciles pueden caer a lados distintos.

Dentro de la frontera, los participantes debían idear un calzado para un nicho y llevarlo hasta el lanzamiento, en 18 subtareas creativas, analíticas, de redacción y de persuasión. Frente al grupo sin IA, quienes usaron GPT-4:

  • completaron un 12,2% más de tareas;
  • las terminaron un 25,1% más rápido;
  • subieron la calidad un 33,9% si habían recibido el entrenamiento;
  • y un 29,9% si no.

Fuera de la frontera, la tarea era un caso de negocios: recomendarle a un gerente general qué marca tenía más potencial, cruzando una planilla con entrevistas internas. La planilla parecía completa, pero las entrevistas traían detalles que cambiaban la respuesta, y el modelo llegaba a una conclusión equivocada. La proporción de respuestas correctas quedó así:

  • sin IA: 84,5%;
  • con GPT-4: 70,6%;
  • con GPT-4 y entrenamiento: 60%.

En promedio, usar IA restó 19 puntos porcentuales de acierto. El grupo entrenado, que fue el que más ganó dentro de la frontera, acertó todavía menos fuera de ella, pero la diferencia entre los dos grupos con IA es débil: significativa solo al 10%. Los dos grupos con IA, además, dedicaron menos tiempo a esta tarea que el grupo sin IA; el entrenado, más de 11 minutos menos, un 30% menos.

El tercer hallazgo explica por qué el error es difícil de ver. Evaluadores que no conocían la respuesta correcta puntuaron la coherencia y la capacidad de persuasión de cada recomendación. Quienes usaron IA salieron mejor evaluados, también cuando se habían equivocado. Los autores concluyen que la IA mejora la presentación y la argumentación aunque el análisis esté mal. Un resultado adicional: dentro de la frontera, los que partían en la mitad inferior de la tarea de base fueron los que más ganaron, aunque la mitad superior también mejoró.

Lo que queda establecido es que el mismo modelo, usado por los mismos profesionales en tareas de su oficio, subió el desempeño en unas y lo bajó en otra, y que desde adentro del trabajo no era evidente cuál era cuál.

Segunda lectura: desde América Latina

Es la segunda Doble Lectura seguida sobre un experimento de un equipo en buena parte compartido, con Dell’Acqua, Lifshitz, Mollick y Lakhani en ambos. La anterior mostraba cuánto suma la IA a un profesional; esta muestra dónde resta.

Lo más útil para la región está en dos resultados de distinta solidez. El sólido: fuera de la frontera, quienes usaron IA acertaron menos, y sus respuestas equivocadas convencieron más a quienes las evaluaron. El frágil: el grupo entrenado en escribir instrucciones acertó todavía menos, con una diferencia débil y habiendo trabajado menos tiempo.

Para las escuelas de gobierno que capacitan funcionarios, el resultado frágil admite una sola lectura prudente: enseñar a pedirle mejor las cosas al modelo no protegió contra el error en la tarea donde el modelo fallaba. El estudio no midió la confianza de los participantes, así que no dice por qué el grupo entrenado acertó menos. Sí sugiere que un curso debería incluir tareas donde el modelo se equivoca, y no solo ejemplos donde brilla.

El resultado sólido toca a quien revisa, por ejemplo un comité que puntúa propuestas en una licitación con una rúbrica de claridad y fundamentación. Si los documentos que recibe se escriben con IA, el hallazgo sobre la coherencia indica que esa rúbrica puede premiar un análisis equivocado bien redactado. Leído desde la región, la consecuencia práctica es que la revisión tiene que volver a los datos de origen, y eso exige presupuestar horas de revisor para rehacer partes del análisis, no solo para leer el documento.

Un tercer punto queda abierto. Que los consultores de menor desempeño inicial hayan ganado más dentro de la frontera sugiere que la herramienta podría achicar brechas en equipos públicos con poca experiencia. Todavía no se sabe si esa ventaja se mantiene cuando el mismo equipo enfrenta, sin aviso, una tarea que queda fuera.

La implicación concreta para un ministerio que adopta asistentes de IA es dónde poner el esfuerzo. Esta evidencia apunta a mapear qué tareas del propio flujo quedan fuera de la frontera y reforzar ahí la revisión humana: el entrenamiento en instrucciones mejoró el rendimiento dentro de la frontera, pero no protegió fuera de ella.

La letra chica

  • Hay una sola tarea fuera de la frontera, ubicada ahí con pruebas previas: una limitación que los autores reconocen.
  • Dentro de la frontera la calidad se midió con evaluaciones subjetivas, algo que los autores declaran. Réplicas con expertos en calzado apuntan en la misma dirección.
  • El modelo fue GPT-4 en su versión de abril de 2023. Los autores advierten que la frontera no está fija y que una tarea puede pasar adentro con un modelo nuevo.
  • Participantes al inicio de su carrera, con incentivos que premiaban la calidad dentro del plazo.
  • Conflicto de interés: tres coautores figuran con afiliación al BCG Henderson Institute, y la empresa recolectó los datos. El preregistro no incluía el encuadre de la frontera dentada.
  • Vale para trabajo profesional complejo con un modelo de 2023. Dónde queda hoy la frontera es algo que cada organización tiene que volver a medir.

Revisado el 28 de septiembre de 2026. La versión original afirmaba que el grupo entrenado en escribir instrucciones “fue el que más se equivocó” y que un curso así “puede subir la confianza en la herramienta”. En el paper, la diferencia entre los dos grupos con IA es significativa solo al 10%, ese grupo trabajó menos tiempo en la tarea y la confianza no se midió. Se ajustaron esas frases y el título.

Palabras clave del paper: technology and innovation management, organizational economics, economics and organization, organization and management theory, research design and methods, field experiments, implementation of new technology, organizational processes

Lectura automática. Este texto lo generó Claude, un modelo de Anthropic, a partir de la fuente original, sin revisión humana línea por línea. Puede contener errores o interpretaciones discutibles; para validar cualquier punto, revisa la fuente original.
¿Viste un error? Repórtalo

Cuéntanos qué está mal, citando la frase si puedes, y, si la tienes, la fuente que lo corrige. Un proceso automático revisa los reportes cada noche: si el error se verifica, la página se corrige y queda una fe de erratas al pie.

Tu correo es opcional: solo lo usamos si necesitamos más contexto sobre el reporte. No te suscribe al newsletter.