La ficha
- Qué es: The Cybernetic Teammate: A Field Experiment on Generative AI and Teamwork
- Quiénes: Fabrizio Dell’Acqua, Raffaella Sadun y Karim R. Lakhani (Harvard Business School), Charles Ayoubi (ESSEC), Hila Lifshitz (Warwick Business School), Ethan Mollick y Lilach Mollick (Wharton), más cuatro profesionales de Procter & Gamble: Yi Han, Jeff Goldman, Hari Nair y Stew Taub.
- Dónde: Organization Science, vol. 37, núm. 4, julio-agosto de 2026, pp. 1217-1242, en acceso abierto. doi.org/10.1287/orsc.2025.20702
- Tipo: experimento de campo preregistrado, diseño 2 × 2, dentro de una sola empresa.
Primera lectura: qué hace y qué encuentra
El estudio se hizo entre mayo y julio de 2024 en Procter & Gamble, con 791 profesionales de las áreas comercial y de investigación y desarrollo. Cada uno dedicó una jornada a un taller virtual de desarrollo de producto, sobre desafíos reales de su propia unidad de negocio. El sorteo los asignó a cuatro condiciones: solos sin IA, en pareja interfuncional sin IA, solos con IA, o en pareja con IA. La herramienta estaba construida sobre GPT-4. Evaluadores expertos, ciegos a la condición de cada participante, puntuaron las soluciones, y esos puntajes se estandarizaron contra el grupo que trabajó solo y sin IA.
La calidad, medida en desviaciones estándar sobre ese grupo de control, quedó así:
- pareja sin IA: 0,24
- persona sola con IA: 0,37
- pareja con IA: 0,39
Ahí está el primer hallazgo. La persona sola con IA alcanzó el nivel de la pareja humana, y sumar la IA a la pareja casi no movió el promedio por sobre eso.
El segundo hallazgo es sobre expertise. Sin IA, los del área comercial proponían ideas comerciales y los de investigación y desarrollo proponían ideas técnicas, con distribuciones claramente distintas. Con IA esa distinción se diluye y ambos grupos generan una mezcla parecida, sin que la calidad varíe de forma significativa según qué tan técnica fuera la solución. El resultado más llamativo se dio entre quienes no trabajan habitualmente en desarrollo de producto: solos y con IA, llegaron al nivel de los equipos que incluían a alguien que sí lo hace a diario.
El tercer hallazgo es el que más cuesta de digerir. Como todos generaron cinco ideas antes de elegir una y desarrollarla, los autores separaron las dos etapas. La IA subió la calidad promedio de las ideas a lo largo de toda la distribución, sin achicar la distancia entre la mejor y la peor. Pero al escoger cuál de las cinco desarrollar, quienes trabajaron sin IA parecen haber acertado más: las parejas sin IA se quedaron con su mejor idea alrededor de la mitad de las veces, y las condiciones con IA en torno al 37%. Aun así, como partían de ideas mejores, las ideas elegidas por quienes tenían IA siguieron siendo de mayor calidad. Los autores ofrecen explicaciones posibles, entre ellas la tendencia de los modelos a validar lo que el usuario ya trae, advierten que quizás los participantes no usaron la IA para elegir, y dejan el punto abierto. Describen a la IA como un amplificador de calidad más que como un mejor decisor. Hay otros dos resultados: las parejas con IA colocaron más soluciones en el decil superior, y quienes usaron IA reportaron más emociones positivas y menos negativas al terminar.
Lo que queda establecido en este contexto es una asimetría entre etapas. La IA levantó el piso de la generación de ideas hasta igualar lo que aportaba un segundo profesional, y no mejoró el paso siguiente, que es elegir bien.
Segunda lectura: desde América Latina
El experimento cubrió cuatro unidades de negocio en dos geografías, Europa y las Américas, y el paper no desagrega países.
Nuestra lectura es que el resultado con traducción más directa a la región es el de sustitución. Para una empresa mediana en Chile o en Colombia que no tiene un área de investigación y desarrollo separada de la comercial, el cuello de botella no es la falta de ideas sino que no hay con quién cruzarlas: sumar un segundo profesional especializado cuesta un sueldo, y lo que recibieron los participantes del estudio fue una licencia y una hora de entrenamiento. El hallazgo de que la persona sola con IA alcanzó el nivel de la pareja interfuncional habla justo de ese margen.
El hallazgo sobre la etapa de selección cambia algo concreto en cómo se compra. Una unidad de innovación de un ministerio en Chile o en Brasil que hoy redacta las bases para contratar un asistente de IA puede especificarlo para generar y redactar borradores, y dejar escrito que la elección entre alternativas sigue siendo una decisión humana documentada, con tiempo asignado. Eso no es celo burocrático: la única etapa donde el grupo sin IA salió mejor fue justamente la de identificar su propia mejor idea.
Un tercer punto queda como hipótesis. En la región es común que un equipo público pequeño tenga a una sola persona a cargo de un tema, sin un colega especializado a quien preguntarle. Que los empleados menos familiarizados con la tarea hayan alcanzado con la herramienta el nivel de equipos que incluían a alguien experimentado sugiere que ese es un perfil donde rinde especialmente. Extrapolarlo al sector público de la región es nuestra apuesta, no la de los autores.
Lo concreto para la región es un criterio de dónde poner la herramienta primero. Donde falta con quién contrastar una idea, esta evidencia dice que una licencia y algo de entrenamiento mueven la aguja. Donde el problema es elegir bien entre varias opciones que ya existen, la evidencia no ofrece apoyo, y algo apunta en contra.
La letra chica
- El preregistro cubría desempeño y expertise. Las emociones iban como variable de interés con efectos poco claros, y el análisis de la cola alta surgió durante la investigación: es exploratorio.
- Alcance declarado por los autores: una empresa de consumo masivo, una jornada virtual, parejas armadas al azar entre personas que en general no se conocían. Los comparan con equipos relámpago, no con equipos establecidos.
- Los participantes tenían poca experiencia con la herramienta, y los autores presentan los beneficios como un piso, no un techo.
- Conflicto de interés: cuatro coautores trabajan en Procter & Gamble y el diseño se acordó con su liderazgo. Es evidencia desde adentro de la organización estudiada, con preregistro y evaluadores ciegos.
- Hasta ahí llega: una empresa, una tarea de ideación temprana, un modelo. Qué ocurre cuando el uso se sostiene en el tiempo queda como pregunta abierta de los propios autores.
Palabras clave del paper: technology and innovation management, research design and methods, field experiments, implementation of new technology, organization and management theory, organizational processes, economics and organization, organizational economics
Lectura automática. Este texto lo generó Claude, un modelo de Anthropic, a partir de la fuente original, sin revisión humana línea por línea. Puede contener errores o interpretaciones discutibles; para validar cualquier punto, revisa la fuente original.