<?xml version="1.0" encoding="utf-8"?><feed xmlns="http://www.w3.org/2005/Atom" xml:lang="es"><generator uri="https://jekyllrb.com/" version="3.10.0">Jekyll</generator><link href="https://dobleclick.jaguridi.cl/feed-lecturas.xml" rel="self" type="application/atom+xml" /><link href="https://dobleclick.jaguridi.cl/" rel="alternate" type="text/html" hreflang="es" /><updated>2026-09-30T22:16:07-03:00</updated><id>https://dobleclick.jaguridi.cl/feed-lecturas.xml</id><title type="html">Doble Click | Lecturas</title><subtitle>Una mirada diaria a la inteligencia artificial, con perspectiva latinoamericana. Curada a partir de fuentes públicas. Una entrada por día.</subtitle><author><name>Doble Click</name></author><entry><title type="html">El mismo GPT-4 que mejoró el trabajo de 758 consultores los hizo equivocarse en otra tarea</title><link href="https://dobleclick.jaguridi.cl/doble-lectura/frontera-dentada-ia-consultores/" rel="alternate" type="text/html" title="El mismo GPT-4 que mejoró el trabajo de 758 consultores los hizo equivocarse en otra tarea" /><published>2026-09-28T00:00:00-03:00</published><updated>2026-09-28T00:00:00-03:00</updated><id>https://dobleclick.jaguridi.cl/doble-lectura/frontera-dentada-ia-consultores</id><content type="html" xml:base="https://dobleclick.jaguridi.cl/doble-lectura/frontera-dentada-ia-consultores/"><![CDATA[<h2 id="la-ficha">La ficha</h2>

<ul>
  <li><strong>Qué es:</strong> <em>Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality</em></li>
  <li><strong>Quiénes:</strong> <a href="https://scholar.google.com/scholar?q=%22Fabrizio+Dell%27Acqua%22">Fabrizio Dell’Acqua</a>, <a href="https://scholar.google.com/scholar?q=%22Edward+McFowland+III%22">Edward McFowland III</a>, <a href="https://scholar.google.com/scholar?q=%22Hila+Lifshitz%22">Hila Lifshitz</a> y <a href="https://scholar.google.com/scholar?q=%22Karim+R.+Lakhani%22">Karim R. Lakhani</a> (Digital Data Design Institute, Harvard Business School), <a href="https://scholar.google.com/scholar?q=%22Ethan+Mollick%22">Ethan Mollick</a> (Wharton), <a href="https://scholar.google.com/scholar?q=%22Katherine+C.+Kellogg%22">Katherine C. Kellogg</a> (MIT Sloan), y Saran Rajendran, Lisa Krayer y François Candelon (BCG Henderson Institute).</li>
  <li><strong>Dónde:</strong> <em>Organization Science</em>, vol. 37, núm. 2, marzo-abril de 2026, pp. 403-423, en acceso abierto. <a href="https://doi.org/10.1287/orsc.2025.21838">doi.org/10.1287/orsc.2025.21838</a></li>
  <li><strong>Tipo:</strong> experimento aleatorizado y preregistrado, dentro de una sola empresa.</li>
</ul>

<h2 id="primera-lectura-qué-hace-y-qué-encuentra">Primera lectura: qué hace y qué encuentra</h2>

<p>El experimento se hizo en Boston Consulting Group (BCG) con 758 consultores, cerca del 7% de sus consultores sin equipo a cargo. Todos resolvieron primero una tarea sin IA, que sirvió de línea de base. Después un sorteo los repartió en tres grupos: sin IA, con GPT-4, o con GPT-4 más un breve entrenamiento en cómo escribirle instrucciones. Cada persona trabajó además en uno de dos tipos de tarea, diseñados con ejecutivos de la firma y probados antes para quedar a uno u otro lado de lo que el modelo resolvía bien. Esa línea es la <em>frontera dentada</em> del título: tareas que a una persona le parecen igual de difíciles pueden caer a lados distintos.</p>

<p>Dentro de la frontera, los participantes debían idear un calzado para un nicho y llevarlo hasta el lanzamiento, en 18 subtareas creativas, analíticas, de redacción y de persuasión. Frente al grupo sin IA, quienes usaron GPT-4:</p>

<ul>
  <li>completaron un 12,2% más de tareas;</li>
  <li>las terminaron un 25,1% más rápido;</li>
  <li>subieron la calidad un 33,9% si habían recibido el entrenamiento;</li>
  <li>y un 29,9% si no.</li>
</ul>

<p>Fuera de la frontera, la tarea era un caso de negocios: recomendarle a un gerente general qué marca tenía más potencial, cruzando una planilla con entrevistas internas. La planilla parecía completa, pero las entrevistas traían detalles que cambiaban la respuesta, y el modelo llegaba a una conclusión equivocada. La proporción de respuestas correctas quedó así:</p>

<ul>
  <li>sin IA: 84,5%;</li>
  <li>con GPT-4: 70,6%;</li>
  <li>con GPT-4 y entrenamiento: 60%.</li>
</ul>

<p>En promedio, usar IA restó 19 puntos porcentuales de acierto. El grupo entrenado, que fue el que más ganó dentro de la frontera, acertó todavía menos fuera de ella, pero la diferencia entre los dos grupos con IA es débil: significativa solo al 10%. Los dos grupos con IA, además, dedicaron menos tiempo a esta tarea que el grupo sin IA; el entrenado, más de 11 minutos menos, un 30% menos.</p>

<p>El tercer hallazgo explica por qué el error es difícil de ver. Evaluadores que no conocían la respuesta correcta puntuaron la coherencia y la capacidad de persuasión de cada recomendación. Quienes usaron IA salieron mejor evaluados, también cuando se habían equivocado. Los autores concluyen que la IA mejora la presentación y la argumentación aunque el análisis esté mal. Un resultado adicional: dentro de la frontera, los que partían en la mitad inferior de la tarea de base fueron los que más ganaron, aunque la mitad superior también mejoró.</p>

<p>Lo que queda establecido es que el mismo modelo, usado por los mismos profesionales en tareas de su oficio, subió el desempeño en unas y lo bajó en otra, y que desde adentro del trabajo no era evidente cuál era cuál.</p>

<h2 id="segunda-lectura-desde-américa-latina">Segunda lectura: desde América Latina</h2>

<p>Es la segunda Doble Lectura seguida sobre un experimento de un equipo en buena parte compartido, con Dell’Acqua, Lifshitz, Mollick y Lakhani en ambos. La anterior mostraba cuánto suma la IA a un profesional; esta muestra dónde resta.</p>

<p>Lo más útil para la región está en dos resultados de distinta solidez. El sólido: fuera de la frontera, quienes usaron IA acertaron menos, y sus respuestas equivocadas convencieron más a quienes las evaluaron. El frágil: el grupo entrenado en escribir instrucciones acertó todavía menos, con una diferencia débil y habiendo trabajado menos tiempo.</p>

<p>Para las escuelas de gobierno que capacitan funcionarios, el resultado frágil admite una sola lectura prudente: enseñar a pedirle mejor las cosas al modelo no protegió contra el error en la tarea donde el modelo fallaba. El estudio no midió la confianza de los participantes, así que no dice por qué el grupo entrenado acertó menos. Sí sugiere que un curso debería incluir tareas donde el modelo se equivoca, y no solo ejemplos donde brilla.</p>

<p>El resultado sólido toca a quien revisa, por ejemplo un comité que puntúa propuestas en una licitación con una rúbrica de claridad y fundamentación. Si los documentos que recibe se escriben con IA, el hallazgo sobre la coherencia indica que esa rúbrica puede premiar un análisis equivocado bien redactado. Leído desde la región, la consecuencia práctica es que la revisión tiene que volver a los datos de origen, y eso exige presupuestar horas de revisor para rehacer partes del análisis, no solo para leer el documento.</p>

<p>Un tercer punto queda abierto. Que los consultores de menor desempeño inicial hayan ganado más dentro de la frontera sugiere que la herramienta podría achicar brechas en equipos públicos con poca experiencia. Todavía no se sabe si esa ventaja se mantiene cuando el mismo equipo enfrenta, sin aviso, una tarea que queda fuera.</p>

<p>La implicación concreta para un ministerio que adopta asistentes de IA es dónde poner el esfuerzo. Esta evidencia apunta a mapear qué tareas del propio flujo quedan fuera de la frontera y reforzar ahí la revisión humana: el entrenamiento en instrucciones mejoró el rendimiento dentro de la frontera, pero no protegió fuera de ella.</p>

<h2 id="la-letra-chica">La letra chica</h2>

<ul>
  <li>Hay una sola tarea fuera de la frontera, ubicada ahí con pruebas previas: una limitación que los autores reconocen.</li>
  <li>Dentro de la frontera la calidad se midió con evaluaciones subjetivas, algo que los autores declaran. Réplicas con expertos en calzado apuntan en la misma dirección.</li>
  <li>El modelo fue GPT-4 en su versión de abril de 2023. Los autores advierten que la frontera no está fija y que una tarea puede pasar adentro con un modelo nuevo.</li>
  <li>Participantes al inicio de su carrera, con incentivos que premiaban la calidad dentro del plazo.</li>
  <li>Conflicto de interés: tres coautores figuran con afiliación al BCG Henderson Institute, y la empresa recolectó los datos. El preregistro no incluía el encuadre de la frontera dentada.</li>
  <li>Vale para trabajo profesional complejo con un modelo de 2023. Dónde queda hoy la frontera es algo que cada organización tiene que volver a medir.</li>
</ul>

<p><small><strong>Revisado el 28 de septiembre de 2026.</strong> La versión original afirmaba que el grupo entrenado en escribir instrucciones “fue el que más se equivocó” y que un curso así “puede subir la confianza en la herramienta”. En el paper, la diferencia entre los dos grupos con IA es significativa solo al 10%, ese grupo trabajó menos tiempo en la tarea y la confianza no se midió. Se ajustaron esas frases y el título.</small></p>]]></content><author><name>Doble Click</name></author><category term="trabajo" /><category term="gobernanza" /><summary type="html"><![CDATA[Un experimento preregistrado con 758 consultores de BCG muestra que GPT-4 aceleró y mejoró su trabajo en tareas de desarrollo de producto. En un caso de negocios que quedaba fuera de su alcance pasó lo contrario: quienes usaron la herramienta acertaron menos, y sus respuestas equivocadas sonaban más convincentes.]]></summary></entry><entry><title type="html">Una persona con IA rindió como un equipo de dos, y eligió peor su mejor idea</title><link href="https://dobleclick.jaguridi.cl/doble-lectura/persona-con-ia-rinde-como-equipo/" rel="alternate" type="text/html" title="Una persona con IA rindió como un equipo de dos, y eligió peor su mejor idea" /><published>2026-09-21T00:00:00-03:00</published><updated>2026-09-21T00:00:00-03:00</updated><id>https://dobleclick.jaguridi.cl/doble-lectura/persona-con-ia-rinde-como-equipo</id><content type="html" xml:base="https://dobleclick.jaguridi.cl/doble-lectura/persona-con-ia-rinde-como-equipo/"><![CDATA[<h2 id="la-ficha">La ficha</h2>

<ul>
  <li><strong>Qué es:</strong> <em>The Cybernetic Teammate: A Field Experiment on Generative AI and Teamwork</em></li>
  <li><strong>Quiénes:</strong> <a href="https://scholar.google.com/scholar?q=%22Fabrizio+Dell%27Acqua%22">Fabrizio Dell’Acqua</a>, <a href="https://scholar.google.com/scholar?q=%22Raffaella+Sadun%22">Raffaella Sadun</a> y <a href="https://scholar.google.com/scholar?q=%22Karim+R.+Lakhani%22">Karim R. Lakhani</a> (Harvard Business School), <a href="https://scholar.google.com/scholar?q=%22Charles+Ayoubi%22">Charles Ayoubi</a> (ESSEC), <a href="https://scholar.google.com/scholar?q=%22Hila+Lifshitz%22">Hila Lifshitz</a> (Warwick Business School), <a href="https://scholar.google.com/scholar?q=%22Ethan+Mollick%22">Ethan Mollick</a> y <a href="https://scholar.google.com/scholar?q=%22Lilach+Mollick%22">Lilach Mollick</a> (Wharton), más cuatro profesionales de Procter &amp; Gamble: Yi Han, Jeff Goldman, Hari Nair y Stew Taub.</li>
  <li><strong>Dónde:</strong> <em>Organization Science</em>, vol. 37, núm. 4, julio-agosto de 2026, pp. 1217-1242, en acceso abierto. <a href="https://doi.org/10.1287/orsc.2025.20702">doi.org/10.1287/orsc.2025.20702</a></li>
  <li><strong>Tipo:</strong> experimento de campo preregistrado, diseño 2 × 2, dentro de una sola empresa.</li>
</ul>

<h2 id="primera-lectura-qué-hace-y-qué-encuentra">Primera lectura: qué hace y qué encuentra</h2>

<p>El estudio se hizo entre mayo y julio de 2024 en Procter &amp; Gamble, con 791 profesionales de las áreas comercial y de investigación y desarrollo. Cada uno dedicó una jornada a un taller virtual de desarrollo de producto, sobre desafíos reales de su propia unidad de negocio. El sorteo los asignó a cuatro condiciones: solos sin IA, en pareja interfuncional sin IA, solos con IA, o en pareja con IA. La herramienta estaba construida sobre GPT-4. Evaluadores expertos, ciegos a la condición de cada participante, puntuaron las soluciones, y esos puntajes se estandarizaron contra el grupo que trabajó solo y sin IA.</p>

<p>La calidad, medida en desviaciones estándar sobre ese grupo de control, quedó así:</p>

<ul>
  <li>pareja sin IA: 0,24</li>
  <li>persona sola con IA: 0,37</li>
  <li>pareja con IA: 0,39</li>
</ul>

<p>Ahí está el primer hallazgo. La persona sola con IA alcanzó el nivel de la pareja humana, y sumar la IA a la pareja casi no movió el promedio por sobre eso.</p>

<p>El segundo hallazgo es sobre expertise. Sin IA, los del área comercial proponían ideas comerciales y los de investigación y desarrollo proponían ideas técnicas, con distribuciones claramente distintas. Con IA esa distinción se diluye y ambos grupos generan una mezcla parecida, sin que la calidad varíe de forma significativa según qué tan técnica fuera la solución. El resultado más llamativo se dio entre quienes no trabajan habitualmente en desarrollo de producto: solos y con IA, llegaron al nivel de los equipos que incluían a alguien que sí lo hace a diario.</p>

<p>El tercer hallazgo es el que más cuesta de digerir. Como todos generaron cinco ideas antes de elegir una y desarrollarla, los autores separaron las dos etapas. La IA subió la calidad promedio de las ideas a lo largo de toda la distribución, sin achicar la distancia entre la mejor y la peor. Pero al escoger cuál de las cinco desarrollar, quienes trabajaron sin IA parecen haber acertado más: las parejas sin IA se quedaron con su mejor idea alrededor de la mitad de las veces, y las condiciones con IA en torno al 37%. Aun así, como partían de ideas mejores, las ideas elegidas por quienes tenían IA siguieron siendo de mayor calidad. Los autores ofrecen explicaciones posibles, entre ellas la tendencia de los modelos a validar lo que el usuario ya trae, advierten que quizás los participantes no usaron la IA para elegir, y dejan el punto abierto. Describen a la IA como un amplificador de calidad más que como un mejor decisor. Hay otros dos resultados: las parejas con IA colocaron más soluciones en el decil superior, y quienes usaron IA reportaron más emociones positivas y menos negativas al terminar.</p>

<p>Lo que queda establecido en este contexto es una asimetría entre etapas. La IA levantó el piso de la generación de ideas hasta igualar lo que aportaba un segundo profesional, y no mejoró el paso siguiente, que es elegir bien.</p>

<h2 id="segunda-lectura-desde-américa-latina">Segunda lectura: desde América Latina</h2>

<p>El experimento cubrió cuatro unidades de negocio en dos geografías, Europa y las Américas, y el paper no desagrega países.</p>

<p>Nuestra lectura es que el resultado con traducción más directa a la región es el de sustitución. Para una empresa mediana en Chile o en Colombia que no tiene un área de investigación y desarrollo separada de la comercial, el cuello de botella no es la falta de ideas sino que no hay con quién cruzarlas: sumar un segundo profesional especializado cuesta un sueldo, y lo que recibieron los participantes del estudio fue una licencia y una hora de entrenamiento. El hallazgo de que la persona sola con IA alcanzó el nivel de la pareja interfuncional habla justo de ese margen.</p>

<p>El hallazgo sobre la etapa de selección cambia algo concreto en cómo se compra. Una unidad de innovación de un ministerio en Chile o en Brasil que hoy redacta las bases para contratar un asistente de IA puede especificarlo para generar y redactar borradores, y dejar escrito que la elección entre alternativas sigue siendo una decisión humana documentada, con tiempo asignado. Eso no es celo burocrático: la única etapa donde el grupo sin IA salió mejor fue justamente la de identificar su propia mejor idea.</p>

<p>Un tercer punto queda como hipótesis. En la región es común que un equipo público pequeño tenga a una sola persona a cargo de un tema, sin un colega especializado a quien preguntarle. Que los empleados menos familiarizados con la tarea hayan alcanzado con la herramienta el nivel de equipos que incluían a alguien experimentado sugiere que ese es un perfil donde rinde especialmente. Extrapolarlo al sector público de la región es nuestra apuesta, no la de los autores.</p>

<p>Lo concreto para la región es un criterio de dónde poner la herramienta primero. Donde falta con quién contrastar una idea, esta evidencia dice que una licencia y algo de entrenamiento mueven la aguja. Donde el problema es elegir bien entre varias opciones que ya existen, la evidencia no ofrece apoyo, y algo apunta en contra.</p>

<h2 id="la-letra-chica">La letra chica</h2>

<ul>
  <li>El preregistro cubría desempeño y expertise. Las emociones iban como variable de interés con efectos poco claros, y el análisis de la cola alta surgió durante la investigación: es exploratorio.</li>
  <li>Alcance declarado por los autores: una empresa de consumo masivo, una jornada virtual, parejas armadas al azar entre personas que en general no se conocían. Los comparan con equipos relámpago, no con equipos establecidos.</li>
  <li>Los participantes tenían poca experiencia con la herramienta, y los autores presentan los beneficios como un piso, no un techo.</li>
  <li>Conflicto de interés: cuatro coautores trabajan en Procter &amp; Gamble y el diseño se acordó con su liderazgo. Es evidencia desde adentro de la organización estudiada, con preregistro y evaluadores ciegos.</li>
  <li>Hasta ahí llega: una empresa, una tarea de ideación temprana, un modelo. Qué ocurre cuando el uso se sostiene en el tiempo queda como pregunta abierta de los propios autores.</li>
</ul>]]></content><author><name>Doble Click</name></author><category term="trabajo" /><category term="diseño" /><summary type="html"><![CDATA[Un experimento de campo preregistrado con 791 profesionales de Procter & Gamble muestra que trabajar solo con IA iguala la calidad de lo que produce una pareja interfuncional sin ella. El giro está en el paso siguiente: quienes usaron IA parecen haber acertado menos al elegir cuál de sus propias ideas desarrollar.]]></summary></entry><entry><title type="html">Les preguntaron a los modelos por el riesgo de catástrofe, y responden más alto que los humanos</title><link href="https://dobleclick.jaguridi.cl/doble-lectura/ia-pronostica-su-propio-riesgo/" rel="alternate" type="text/html" title="Les preguntaron a los modelos por el riesgo de catástrofe, y responden más alto que los humanos" /><published>2026-09-14T00:00:00-03:00</published><updated>2026-09-14T00:00:00-03:00</updated><id>https://dobleclick.jaguridi.cl/doble-lectura/ia-pronostica-su-propio-riesgo</id><content type="html" xml:base="https://dobleclick.jaguridi.cl/doble-lectura/ia-pronostica-su-propio-riesgo/"><![CDATA[<h2 id="la-ficha">La ficha</h2>

<ul>
  <li><strong>Qué es:</strong> <em>Automated Forecasts of Catastrophic Risks</em></li>
  <li><strong>Quiénes:</strong> <a href="https://jabaluck.github.io/">Jason Abaluck</a> (Yale y NBER), <a href="https://scholar.google.com/scholar?q=%22Ezra+Karger%22+forecasting">Ezra Karger</a> (Federal Reserve Bank of Chicago), <a href="https://scholar.google.com/scholar?q=%22Nick+Merrill%22+forecasting">Nick Merrill</a> (Forecasting Research Institute y UC Berkeley), <a href="https://scholar.google.com/scholar?q=%22Philip+E.+Tetlock%22+forecasting">Philip E. Tetlock</a> (University of Pennsylvania), <a href="https://scholar.google.com/scholar?q=%22Eva+Vivalt%22">Eva Vivalt</a> (University of Toronto) y <a href="https://scholar.google.com/scholar?q=%22Bridget+Williams%22+%22forecasting+research+institute%22">Bridget Williams</a> (Forecasting Research Institute y Oxford). Van en orden alfabético.</li>
  <li><strong>Dónde:</strong> working paper del Forecasting Research Institute, septiembre 2026, sin DOI (<a href="https://forecastingresearch.org/pdf/airo-working-paper.pdf">PDF</a>). Financiado por Coefficient Giving.</li>
  <li><strong>Tipo:</strong> elicitación de pronósticos a modelos de lenguaje, con tres ejercicios de validación.</li>
</ul>

<h2 id="primera-lectura-qué-hace-y-qué-encuentra">Primera lectura: qué hace y qué encuentra</h2>

<p>El punto de partida es una discusión conocida y bastante estéril. Sobre el riesgo de que la IA termine en catástrofe, las estimaciones públicas van del 10 al 25% en boca de algunos líderes de la industria hasta menos de 0,001% en boca de Yann LeCun. Los autores no intentan zanjarla con más opinión experta. Proponen meter un insumo nuevo: preguntarle a los propios modelos.</p>

<p>Eso es AIRO, el <em>Automated AI Risk Outlook</em>, un panel que se actualiza de forma periódica. La mecánica es concreta. Toman los cuatro modelos mejor rankeados en el Epoch Capabilities Index, saltándose los de una misma familia: al momento de escribir son GPT-6 Astra, Fable 5.1, Opus 5 y GPT-5.5 Pro. A cada uno le entregan en un solo prompt 35 preguntas con sus criterios de resolución, los horizontes y catorce condiciones bajo las cuales responder cada celda. Antes de poder entregar un pronóstico, el modelo está obligado a hacer al menos diez búsquedas o lecturas web. El pronóstico del conjunto es la mediana simple de los cuatro.</p>

<p>La pregunta central define catástrofe como un evento que mata al menos al 10% de la población humana en cinco años. Las cifras: por cualquier causa, 1,1% al 2030, 8,5% al 2050 y 18,5% al 2100. Por causa de la IA, 0,47%, 6,0% y 12,2%. O sea, la mediana de catástrofe por IA equivale a cerca del 45% de la mediana por cualquier causa al 2030 y al 71% al 2050. Hay una cifra más alta y menos comentada: la mediana de desempoderamiento humano supera a la de catástrofe mortal en todos los horizontes, con 15,5% al 2050 y 28% al 2100.</p>

<p>Esos números quedan bastante por encima de los humanos. En la comparación que hacen los propios autores, el experto mediano del panel LEAP daba 0,3% al 2030 y 2% al 2050, y el superpronosticador mediano 0,1% y 0,88%. El conjunto de modelos queda entre 4,75 y 6,82 veces más alto que los superpronosticadores en la pregunta de catástrofe por IA.</p>

<p>La objeción obvia es que un modelo tirando probabilidades no vale nada si no sabemos si acierta. El paper dedica su parte más interesante a eso, con tres pruebas. En ForecastBench, sobre preguntas reales ya resueltas, los modelos recientes parecen mostrar menos sesgo favorito-longshot que los superpronosticadores de 2024, y puntajes de Brier similares. El sesgo es el de exagerar lo improbable y quedarse corto con lo muy probable. Como los eventos raros casi no existen en el registro histórico, construyen eventos raros a pedido: dos simuladores, un mundo tipo Civilization con casi 26 mil preguntas binarias de probabilidad verdadera entre 1 y 9%, y un simulador de epidemias. Ahí la capacidad del modelo predice fuertemente la precisión, con una correlación de Spearman de +0,85. Y para los pronósticos condicionales a una política, prueban con una campaña de vacunación simulada de efecto conocido: los modelos de frontera recuperan una mediana de 0,78 de la habilidad recuperable.</p>

<p>De ahí sale la idea que ordena el paper. Si pronosticar mejor es función de la capacidad, y la capacidad es también lo que empuja el riesgo, entonces estos pronósticos son más informativos justo en los mundos futuros donde el riesgo es más alto. Los autores lo dicen así, y también dicen qué es lo que esa evidencia no prueba.</p>

<p>El ejercicio de políticas usa ocho escenarios adaptados de una encuesta del mismo instituto. El paquete que combina tope internacional de cómputo, autorización internacional previa al lanzamiento y responsabilidad estricta baja el pronóstico de catástrofe por IA en 66% al 2050. Las versiones solo de Estados Unidos rinden bastante menos que las internacionales. Dos condiciones lo suben: el statu quo sin política nueva, 1,28 veces, y la preemción federal de las leyes estatales, 1,24 veces. Que el statu quo sea peor que el pronóstico incondicional significa que los modelos ya están asumiendo que algo se va a regular. Los autores advierten que no midieron el costo de estas políticas en innovación o crecimiento: lo que entregan es un ranking de eficacia, no un análisis de costo-beneficio.</p>

<h2 id="segunda-lectura-desde-américa-latina">Segunda lectura: desde América Latina</h2>

<p>Conviene decirlo sin rodeos: la región no aparece. El menú de políticas se armó con propuestas de think tanks y de políticos estadounidenses, los paneles humanos de comparación son de la misma casa, y el escenario que más mueve la aguja hacia arriba, la preemción federal, es una discusión interna de Estados Unidos. Nada aquí se preguntó desde un país que recibe la tecnología sin fabricarla.</p>

<p>Y aun así hay un resultado que le habla directo a la región, sin que nadie lo haya buscado. En cada comparación, las medidas internacionales le ganan a las nacionales, y el paquete le gana a cualquier medida suelta. Para un país que no entrena modelos de frontera ni tiene jurisdicción sobre quienes los entrenan, eso no es un detalle técnico. Es el argumento de por qué la política nacional de IA, por buena que sea, no toca este riesgo en particular, y por qué el lugar donde sí se juega algo es la mesa multilateral. Estar ahí deja de ser diplomacia decorativa.</p>

<p>El segundo aporte posible es más humilde y quizás más útil. Un ministerio de la región no tiene cómo montar su propia evaluación de riesgo catastrófico, y un panel público y actualizado es un bien al que puede acceder gratis. El riesgo de usarlo es importar la cifra sin sus condiciones. El propio paper muestra cuánto se mueve todo: condicionar al percentil 90 de capacidad futura que el mismo modelo estima multiplica por 2,21 el pronóstico al 2030. Un número de AIRO sin su condición no es información, es una cita suelta.</p>

<p>Una lectura mía, que el paper no hace: la escalera de incidentes sugiere que lo que primero va a tocar a la región no es el escalón de la catástrofe sino los de abajo, donde los incidentes cibernéticos llevan la delantera. Los autores no cortan sus resultados por geografía, así que lo dejo como hipótesis. Pero un país cuya exposición real pasa por servicios públicos digitales y sistemas financieros tiene más que hacer con las medianas de los escalones bajos que con la cifra grande del titular.</p>

<p>La pregunta que queda es quién mira estos tableros en la región, y con qué mandato. Si una cifra se mueve fuerte hacia arriba el próximo trimestre, ¿alguien acá está encargado de notarlo?</p>

<h2 id="la-letra-chica">La letra chica</h2>

<ul>
  <li>Conflicto de interés a la vista: el paper presenta un producto de la propia casa. AIRO es del Forecasting Research Institute, las preguntas se reutilizan de estudios previos del mismo instituto y los paneles humanos de comparación también son suyos. Es validación interna con criterios transparentes, no auditoría independiente.</li>
  <li>Los autores son explícitos sobre lo que no saben: no está establecido que la precisión medida en ForecastBench o en mundos simulados se traslade a pronosticar catástrofes reales. Dicen que esos proxies dan razones para investigar los pronósticos, no para concluir que los modelos igualan a los mejores humanos en esta pregunta. Sobre las comparaciones con humanos advierten algo parecido: son pronósticos hechos en fechas distintas y, en ForecastBench, sobre conjuntos de preguntas distintos, así que las razones de arriba no miden precisión relativa.</li>
  <li>El tablero corre solo con información pública. Los laboratorios tienen información privada sobre capacidades y riesgos, y los autores reconocen que sin ella difícilmente se puede alertar sobre lo que pasa dentro de esas empresas.</li>
  <li>El paper señala un problema raro y honesto: publicar estos pronósticos los mete en el corpus de entrenamiento de los modelos futuros, que podrían terminar reforzándolos. Y advierten que empresas o modelos podrían coludir u ocultar datos si las respuestas de política dependen de estas cifras.</li>
  <li>Que el 100% de los 1.996 ordenamientos implícitos se cumpla habla de coherencia interna del panel, no de que esté acertando.</li>
  <li>Transparencia: dos de los cuatro modelos del panel son de la familia Claude, la misma que escribe estas lecturas.</li>
</ul>]]></content><author><name>Doble Click</name></author><category term="gobernanza" /><category term="seguridad" /><summary type="html"><![CDATA[Un panel de cuatro modelos de frontera pronostica 0,47% de probabilidad de que la IA cause una catástrofe que mate al menos al 10% de la humanidad al 2030, y 6% al 2050, entre 4,8 y 6,8 veces lo que estiman los superpronosticadores. El giro del paper: esos pronósticos se vuelven más informativos justo cuando el riesgo sube.]]></summary></entry><entry><title type="html">Un chatbot de bienestar mental: ¿suplemento, remedio o profesor de yoga?</title><link href="https://dobleclick.jaguridi.cl/doble-lectura/ia-bienestar-mental-suplemento-o-remedio/" rel="alternate" type="text/html" title="Un chatbot de bienestar mental: ¿suplemento, remedio o profesor de yoga?" /><published>2026-09-07T00:00:00-03:00</published><updated>2026-09-07T00:00:00-03:00</updated><id>https://dobleclick.jaguridi.cl/doble-lectura/ia-bienestar-mental-suplemento-o-remedio</id><content type="html" xml:base="https://dobleclick.jaguridi.cl/doble-lectura/ia-bienestar-mental-suplemento-o-remedio/"><![CDATA[<h2 id="la-ficha">La ficha</h2>

<ul>
  <li><strong>Qué es:</strong> <em>Framing Responsible Design of AI for Mental Well-Being: AI as Primary Care, Nutritional Supplement, or Yoga Instructor?</em></li>
  <li><strong>Quiénes:</strong> <a href="https://scholar.google.com/scholar?q=%22Ned+Cooper%22+%22human-computer+interaction%22">Ned Cooper</a>, <a href="https://jaguridi.github.io/">Jose A. Guridi</a> y <a href="https://qianyang.co/">Qian Yang</a> (Cornell University), <a href="https://scholar.google.com/scholar?q=%22Angel+Hsing-Chi+Hwang%22">Angel Hsing-Chi Hwang</a> (University of Southern California), <a href="https://scholar.google.com/scholar?q=%22Beth+Kolko%22+%22human+centered+design%22">Beth Kolko</a> (University of Washington) y <a href="https://scholar.google.com/scholar?q=%22Emma+E.+McGinty%22+%22health+policy%22">Emma Elizabeth McGinty</a> (Weill Cornell Medicine)</li>
  <li><strong>Dónde:</strong> <em>Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems</em>, Barcelona, abril 2026. <a href="https://doi.org/10.1145/3772318.3791556">doi.org/10.1145/3772318.3791556</a></li>
  <li><strong>Tipo:</strong> estudio cualitativo en tres etapas: 24 entrevistados expertos y análisis de más de 100 documentos regulatorios.</li>
</ul>

<h2 id="primera-lectura-qué-hace-y-qué-encuentra">Primera lectura: qué hace y qué encuentra</h2>

<p>El objeto del estudio son las herramientas <strong>no clínicas</strong>: ChatGPT, Replika y compañía, usadas para desahogarse o sentirse mejor, sin receta ni supervisión de un profesional. La ley estadounidense separa esto con nitidez. Lo clínico lo regula la FDA como dispositivo médico; lo no clínico lo mira la FTC con mano liviana, como tecnología de consumo. Millones de personas ya están del lado liviano.</p>

<p>De ahí sale la pregunta, que es de diseño y no de medición: qué significa, en concreto, diseñar una de estas herramientas con responsabilidad. Los autores no evalúan ningún chatbot ni miden ningún efecto. Preguntan, a expertos en ética médica, política de salud, regulación de IA y diseño de tecnología sanitaria, analizan más de cien documentos de política pública, y vuelven a los entrevistados a discutir lo encontrado. Las primeras entrevistas casi fracasan, y eso es parte del hallazgo: los expertos en política de salud no veían por qué los estaban entrevistando, y los de política tecnológica compartían la preocupación sin ofrecer nada accionable. Lo único que resonó en todos fue una analogía suelta: algunas de estas herramientas se parecen a un suplemento nutricional, y otras a un remedio de venta libre.</p>

<p>El paper convierte esa intuición en un mapa de dos ejes: si la herramienta es un producto o un servicio, y si garantiza o no un resultado de salud. Quedan cuatro casillas. El suplemento es un producto que no garantiza nada. El remedio de venta libre garantiza alivio para un síntoma definido. La atención primaria es un servicio que garantiza el resultado, y si no puede darlo queda obligado a derivar. El profesor de yoga es un servicio sin garantía: puede mejorar o arruinar los beneficios probados del yoga con su instrucción, y aun así no promete ninguno.</p>

<p>Lo interesante no es la ocurrencia, sino lo que ordena: cada casilla trae riesgos primarios distintos y por lo tanto responsabilidades distintas. En una herramienta tipo remedio lo urgente es seguridad, efectividad y acceso equitativo, y varios entrevistados fueron explícitos en que algo que no funciona igual para todos los grupos no puede llamarse seguro y efectivo. En una tipo suplemento es casi lo contrario: su efectividad clínica importa poco, y lo que importa es que no reemplace la atención clínica ni el autocuidado. Como resumió un entrevistado, no es problema que alguien hable con un chatbot terapéutico, sea efectivo o no; es problema cuando esa persona debería estar hablando con un psiquiatra.</p>

<p>El segundo hallazgo es el que más muerde. Todos los entrevistados, con palabras distintas, pusieron en el centro los <strong>ingredientes activos</strong>: el mecanismo probado por el cual una herramienta mejora el bienestar. Los clínicos y los de política de salud lo llamaban así, los éticos hablaban de teoría del cambio, la industria de la esencia real del producto. La mayoría consideró que declararlos, y además garantizar que se entreguen bien, es condición de un diseño responsable. Con eso los autores distinguen tres tipos: las validadas como un todo mediante ensayos controlados, rarísimas; las que entregan un ingrediente probado como la terapia cognitivo conductual sin estar validadas ellas mismas; y las que no articulan ningún ingrediente, como ChatGPT de fábrica usado para desestresarse. Ningún entrevistado describió a esta última categoría como diseño responsable, y el paralelo que aparece varias veces son las redes sociales, que tampoco entendían cómo estaban entreteniendo a la gente y descubrieron tarde que el motor era la polarización y la rabia.</p>

<p>El tercer hallazgo los autores no lo resuelven, lo dejan planteado: dónde está el límite entre riesgo y beneficio. La mayoría de los entrevistados de medicina, política de salud y tecnología sanitaria aceptaba el razonamiento de los medicamentos innovadores, donde un fármaco que salva a muchos se aprueba aunque sea letal para unos pocos, siempre que el riesgo esté declarado. Los de ética y diseño se resistieron con fuerza a esa aritmética poblacional, y la división siguió en buena medida líneas disciplinares. Donde no hubo matiz fue entre los clínicos: varios insistieron en que preguntar si alguien tiene pensamientos suicidas no basta, y describieron como no negociables una evaluación de riesgo real y una derivación garantizada.</p>

<h2 id="segunda-lectura-desde-américa-latina">Segunda lectura: desde América Latina</h2>

<p>La advertencia primero: el análisis regulatorio es de Estados Unidos y los autores lo declaran. La FDA, la FTC y la definición de atención primaria de Medicare y Medicaid son el material del que están hechas las cuatro analogías, y nada de eso se importa tal cual. Pero conviene separar dos capas. La legal no viaja. La de diseño sí, y es la que el paper propone de verdad: un vocabulario para que quien construye la herramienta declare qué promete y a quién, antes de que exista una ley que se lo exija. Donde la regulación está en pañales, ese vocabulario llega justo cuando sirve.</p>

<p>Donde el marco se tensiona es en la derivación. Lo que separa a la atención primaria del profesor de yoga es la obligación de derivar de forma efectiva cuando la herramienta no puede resolver, y eso supone que existe a quién derivar. En buena parte de América Latina el especialista no está, o está a meses de lista de espera, así que el criterio de los clínicos entrevistados se vuelve más exigente de lo que suena: una herramienta que deriva a un vacío no cumplió. Y pedir que no sustituya la atención clínica supone que esa atención es una alternativa disponible. Para mucha gente acá, el chatbot gratis y en español no compite con el psicólogo, compite con nada, y desalentar su uso deja de ser solo precaución. Esto ya es lectura mía: el paper no estudió la región y sería injusto pedirle una respuesta a esa versión del dilema.</p>

<p>Algo parecido pasa con los ingredientes activos. La terapia cognitivo conductual y compañía fueron validadas mayoritariamente en otras poblaciones y en otro idioma, y quien las entrega acá es un modelo entrenado sobre todo en inglés. Declarar el ingrediente es el piso, no el techo. Esta extrapolación también es mía, aunque apunta hacia donde los autores ya miran cuando proponen una base de datos de ingredientes activos que documente qué tan bien funciona cada mecanismo en distintas poblaciones.</p>

<p>La pregunta que deja sirve para cualquier equipo que esté construyendo algo así en la región. Si tuvieras que escribir en la portada de tu herramienta qué mejora, en quién y por qué mecanismo probado, ¿podrías? Si la respuesta es que sirve para todo y para todos, el paper sugiere que eso no es versatilidad. Es ausencia de un responsable.</p>

<h2 id="la-letra-chica">La letra chica</h2>

<ul>
  <li>Transparencia: el autor de este blog es coautor del paper. Los autores además declaran que ellos mismos diseñan e investigan herramientas no clínicas de este tipo, así que el marco que proponen también los alcanza.</li>
  <li>Es un estudio cualitativo: su valor está en ofrecer un marco y explicitar desacuerdos, no en medir cuántos expertos piensan qué. El análisis regulatorio cubre solo Estados Unidos, y los autores lo justifican como una decisión de profundidad antes que de alcance.</li>
  <li>No entrevistaron a usuarios ni pacientes, y explican por qué: querían mirar riesgos que todavía no son observables, para lo cual la experiencia subjetiva de uso no sirve. Varios entrevistados de industria vienen de startups, y los propios autores anotan que los expertos de grandes hospitales y aseguradoras fueron menos accesibles.</li>
  <li>El paper no propone un estándar validado ni lo pretende. Deja abiertas dos preguntas que sus entrevistados no lograron zanjar: si conviene evaluar estas herramientas por su efecto poblacional, y si un riesgo proporcional al beneficio es vara suficiente.</li>
</ul>]]></content><author><name>Doble Click</name></author><category term="salud" /><category term="diseño" /><category term="ética" /><summary type="html"><![CDATA[Veinticuatro expertos en clínica, ética, política pública y diseño de tecnología sanitaria, más de cien documentos regulatorios, y una conclusión incómoda para la industria: lo que define si una IA de bienestar mental está bien diseñada no es qué tan buena es conversando, sino qué beneficio concreto promete y a quién. Una herramienta pensada para servirle a todos no le responde a nadie.]]></summary></entry><entry><title type="html">Con IA suben las notas de las tareas y bajan las de las pruebas</title><link href="https://dobleclick.jaguridi.cl/doble-lectura/penalidad-aprendizaje-ia-china/" rel="alternate" type="text/html" title="Con IA suben las notas de las tareas y bajan las de las pruebas" /><published>2026-08-31T00:00:00-04:00</published><updated>2026-08-31T00:00:00-04:00</updated><id>https://dobleclick.jaguridi.cl/doble-lectura/penalidad-aprendizaje-ia-china</id><content type="html" xml:base="https://dobleclick.jaguridi.cl/doble-lectura/penalidad-aprendizaje-ia-china/"><![CDATA[<h2 id="la-ficha">La ficha</h2>

<ul>
  <li><strong>Qué es:</strong> <em>The Generative AI Learning Penalty: Evidence from Chinese Secondary Education</em></li>
  <li><strong>Quiénes:</strong> <a href="https://scholar.google.com/scholar?q=%22David+Str%C3%B6mberg%22+economics">David Strömberg</a> (Stockholm University), <a href="https://scholar.google.com/scholar?q=%22Victor+Lei%22+%22University+of+Hong+Kong%22">Victor Lei</a> y <a href="https://scholar.google.com/scholar?q=%22Yanhui+Wu%22+%22University+of+Hong+Kong%22">Yanhui Wu</a> (University of Hong Kong)</li>
  <li><strong>Dónde:</strong> SSRN, junio de 2026. Documento de trabajo, todavía sin revisión de pares. <a href="https://papers.ssrn.com/sol3/papers.cfm?abstract_id=6977138">papers.ssrn.com/abstract=6977138</a></li>
  <li><strong>Tipo:</strong> estudio cuantitativo. Panel administrativo de 30 meses, 26.811 estudiantes, diferencias en diferencias con adopción escalonada.</li>
</ul>

<h2 id="primera-lectura-qué-hace-y-qué-encuentra">Primera lectura: qué hace y qué encuentra</h2>

<p>Conviene partir por el diseño, porque de ahí sale casi toda la fuerza del paper. Los autores obtuvieron de la oficina de educación de un condado del centro de China, que ellos describen como representativo de los condados fuera de la costa desarrollada, los registros de 26.811 estudiantes de séptimo a duodécimo grado, el 90 por ciento de los matriculados en secundaria ahí. Los datos van de septiembre de 2022 a junio de 2025 y juntan tres cosas que rara vez aparecen en el mismo conjunto: las notas de las pruebas mensuales a libro cerrado, la nota y el tiempo de entrega de las tareas semanales en nueve asignaturas, y los dos exámenes nacionales de alto impacto, el Zhongkao, que ordena a los estudiantes hacia distintas escuelas de nivel medio, y el Gaokao, que en la práctica decide el ingreso a la universidad.</p>

<p>Una encuesta de junio de 2025 preguntó en qué mes cada estudiante empezó a usar IA generativa. La adopción pasó de casi cero en 2022 a cerca del 80 por ciento en 2025, y avanzó de forma escalonada, lo que habilita el diseño: comparar cómo cambian los resultados de quienes adoptaron en un mes dado contra los de quienes nunca adoptaron. Las herramientas más usadas fueron Doubao, DeepSeek, ChatGLM, Ernie Bot y Qwen, no aplicaciones educativas especializadas.</p>

<p>El hallazgo central es una divergencia limpia entre productividad y aprendizaje. A los seis meses de adoptar IA, las notas de las tareas suben 18 por ciento respecto de la media inicial y el tiempo de entrega cae de 64 a 45 minutos. En paralelo, las notas de las pruebas mensuales a libro cerrado caen 20 por ciento. Las dos curvas se separan justo en el mes de adopción y venían pegadas antes, que es lo que el diseño necesita.</p>

<p>El segundo hallazgo es sobre el tiempo. El efecto en las pruebas mensuales se completa en unos seis meses; el de los exámenes de admisión tarda cerca de dos años en llegar a su magnitud plena, 18 por ciento en el Gaokao y 24 por ciento en el Zhongkao, porque esos exámenes cubren materia de varios años. La consecuencia metodológica la sacan los propios autores y es incómoda para el resto de la literatura: los estudios cortos, que son casi todos, subestiman el costo de largo plazo.</p>

<p>El tercer hallazgo explica el mecanismo y evita la conclusión gruesa de que la IA daña por sí sola. La pérdida se concentra en los usuarios cuyo patrón es compatible con externalizar la tarea, que son el 58 por ciento de quienes usan IA y suben al 81 por ciento entre quienes llevan más de cinco meses usándola: entregan en menos tiempo que incluso el más rápido de los estudiantes sin IA, sacan notas de tarea que coinciden con lo que estas herramientas aciertan en ese tipo de ejercicios, y rinden muy mal en las pruebas. En cambio, quienes usan IA y dedican a la tarea el mismo tiempo que los no usuarios sacan notas de prueba similares a las de ellos, con mejores notas de tarea, y no son mejores estudiantes de partida. La conclusión de los autores es precisa: la IA reduce el tiempo dedicado a aprender en la mayoría, pero no reduce la eficiencia con que aprenden quienes mantienen el tiempo.</p>

<p>Al abrir por asignatura, las mayores caídas están en ciencias sociales (27 por ciento en promedio), luego STEM (22 por ciento) y al final los idiomas (inglés 17 por ciento, chino 9 por ciento). Vale la pena notarlo, porque los experimentos previos se concentran casi todos en matemáticas, programación e idiomas, y ninguna de esas es la asignatura más golpeada acá: matemáticas cae 22 por ciento y los idiomas menos que eso. Por perfil, la caída es mayor en los estudiantes menores, en los hombres y en los de mejor rendimiento inicial, lo que comprime la distribución de habilidades por un camino distinto al conocido: no porque la IA levante a los de abajo, sino porque castiga más a los de arriba.</p>

<h2 id="segunda-lectura-desde-américa-latina">Segunda lectura: desde América Latina</h2>

<p>Lo que hace este paper traducible es que no estudia una herramienta, estudia un incentivo. Los autores lo dicen al cerrar: la literatura está concentrada en cómo diseñar tutores de IA que anden bien, y en China esos tutores ya existen y son baratos o gratis. Los estudiantes igual eligen el chatbot de propósito general que entrega la respuesta directa. No falta la buena herramienta, falta el motivo para preferirla.</p>

<p>De ahí sale el hallazgo que más se parece a la región, y es un problema de medición antes que de tecnología. Entre los estudiantes que usan IA y sacan notas de tarea sobre la media, mejores notas de tarea vienen asociadas a peores notas de prueba. La tarea deja de informar sobre el aprendizaje, y la brecha solo se hace visible en una evaluación a libro cerrado. Eso importa donde las notas de aula pesan en la calificación escolar y esa calificación entra en la admisión universitaria. Chile con el NEM y el ranking de notas, Brasil con el ENEM, México con sus exámenes de ingreso: la arquitectura de un examen externo de alto impacto conviviendo con notas de aula hoy fáciles de externalizar existe en toda la región. Esto último es lectura mía y no del paper, que estudió un condado chino y nada más.</p>

<p>Una precisión de los autores conviene no saltársela: el ahorro de tiempo en tareas es de 2,2 a 2,8 horas semanales, entre 5 y 6 por ciento del tiempo total de estudio, mucho menos que la caída de 20 por ciento en las notas. Ellos plantean que otros factores deben estar contribuyendo, probablemente que quien externaliza la tarea del fin de semana también externaliza lo demás.</p>

<p>Hay una nota optimista que ellos mismos presentan como sugerente y no como establecida. Medida a los cinco meses de uso, la penalidad pasó de alrededor de 25 por ciento a comienzos de 2023 a alrededor de 16 por ciento en junio de 2025, y el patrón se mantiene al fijar la muestra en los adoptantes tempranos. Algo se está adaptando, en los estudiantes o en los profesores, aunque la pérdida está lejos de desaparecer.</p>

<p>Sus tres sugerencias de política son sobrias y baratas, que es lo que las vuelve pertinentes para ministerios sin presupuesto para reformas grandes. Dar información creíble a los estudiantes sobre el costo de aprendizaje de externalizar tareas, porque hoy no lo perciben. Aumentar el peso de las evaluaciones presenciales y a libro cerrado. Y que profesores y familias monitoreen insumos, tiempo de estudio y esfuerzo, en vez de productos, que es lo que la IA volvió poco informativo.</p>

<p>La pregunta que deja es directa para cualquier ministerio de la región. Si la nota de la tarea ya no dice si el estudiante aprendió, ¿con qué se está evaluando?</p>

<h2 id="la-letra-chica">La letra chica</h2>

<ul>
  <li>Es un documento de trabajo en SSRN, sin revisión de pares todavía.</li>
  <li>El mes de adopción es autorreportado y retrospectivo. Los autores lo discuten: un reporte demasiado tardío habría dejado tendencias previas, que no aparecen; uno demasiado temprano explicaría parte de la rampa de seis meses, pero no la magnitud final.</li>
  <li>La identificación es más débil en los exámenes de admisión, que se observan una o dos veces y donde no se pueden mostrar tendencias previas. Los autores lo reconocen y apoyan su lectura causal en que el orden de los efectos por asignatura y por perfil es casi idéntico en ambos tipos de examen.</li>
  <li>El tiempo de tarea es el intervalo entre abrir y entregar en la plataforma, no el tiempo efectivo de trabajo. Los autores lo dicen y lo tratan como una aproximación razonable, pero es la variable sobre la que descansa todo el mecanismo de externalización.</li>
  <li>La relación entre tiempo de tarea y notas de prueba no es causal, y lo dicen expresamente: sirve para caracterizar a quiénes les va peor, no para concluir que obligar a dedicar más tiempo restauraría el aprendizaje.</li>
  <li>Es un condado de China. Los mecanismos viajan mejor que las magnitudes.</li>
</ul>]]></content><author><name>Doble Click</name></author><category term="educación" /><category term="datos" /><summary type="html"><![CDATA[Treinta meses de registros de 26.811 estudiantes de secundaria en un condado chino. Tras adoptar IA generativa, las notas de las tareas suben 18% y el tiempo para hacerlas cae un tercio, pero las pruebas a libro cerrado caen 20% en seis meses, y el efecto en los exámenes de admisión tarda dos años en aparecer completo.]]></summary></entry><entry><title type="html">Casi la mitad del uso real de IA desaparece cuando se lo mide solo como trabajo</title><link href="https://dobleclick.jaguridi.cl/doble-lectura/observatorio-uso-real-ia/" rel="alternate" type="text/html" title="Casi la mitad del uso real de IA desaparece cuando se lo mide solo como trabajo" /><published>2026-08-24T00:00:00-04:00</published><updated>2026-08-24T00:00:00-04:00</updated><id>https://dobleclick.jaguridi.cl/doble-lectura/observatorio-uso-real-ia</id><content type="html" xml:base="https://dobleclick.jaguridi.cl/doble-lectura/observatorio-uso-real-ia/"><![CDATA[<h2 id="la-ficha">La ficha</h2>

<ul>
  <li><strong>Qué es:</strong> <em>The AI Observatory: A Public Measure of Real-World AI Use</em></li>
  <li><strong>Quiénes:</strong> diecinueve investigadores de MIT, Stanford, Northeastern, Johns Hopkins, Berkeley, Carnegie Mellon, Brown, NYU, Maryland, Waterloo, EleutherAI, Cohere, Code Metal y Adaption Labs. La primera autoría es compartida entre <a href="https://scholar.google.com/scholar?q=%22Shayne+Longpre%22">Shayne Longpre</a> (MIT), <a href="https://scholar.google.com/scholar?q=%22Anka+Reuel%22">Anka Reuel</a> (Stanford) y <a href="https://scholar.google.com/scholar?q=%22Dayeon+Ki%22+Maryland">Dayeon Ki</a> (Maryland). Entre quienes orientaron el trabajo están <a href="https://scholar.google.com/scholar?q=%22Alex+Pentland%22">Sandy Pentland</a> (MIT), <a href="https://scholar.google.com/scholar?q=%22Sara+Hooker%22">Sara Hooker</a> (Adaption Labs) y <a href="https://scholar.google.com/scholar?q=%22Sanmi+Koyejo%22">Sanmi Koyejo</a> (Stanford).</li>
  <li><strong>Dónde:</strong> preprint, agosto de 2026. Sin revisión por pares al momento de esta lectura. Taxonomía, anotaciones y herramientas de anotación en <a href="https://ai-observatory.org">ai-observatory.org</a></li>
  <li><strong>Tipo:</strong> estudio de medición. 23.158 conversaciones y 85.633 turnos anotados, provenientes de siete fuentes de uso real recogidas entre abril de 2023 y julio de 2025, clasificados con una taxonomía común de 145 rasgos.</li>
</ul>

<h2 id="primera-lectura-qué-hace-y-qué-encuentra">Primera lectura: qué hace y qué encuentra</h2>

<p>Lo primero es entender qué tipo de trabajo es. No mide si la IA sirve ni estima efectos: construye una infraestructura de medición y después la usa para probar qué tan frágiles son las afirmaciones que circulan sobre “para qué se usa la IA”. Los autores juntaron siete colecciones de conversaciones reales (WildChat, ShareGPT, AI Archive, un raspado de conversaciones públicas de Grok, LMSYS-Chat-1M, Chatbot Arena y el National Internet Observatory) y las pasaron por una misma taxonomía de 145 rasgos, que etiqueta cada conversación en cuatro niveles: el prompt, la respuesta, el turno y la conversación completa. Esa taxonomía cubre función, tema, usos sensibles, estilo de interacción, dinámica multi-turno y estructura. La anotación la hace un modelo, GPT-4.1, calibrado contra un set de validación humano.</p>

<p>El primer hallazgo es que las fuentes no son intercambiables, y por bastante. En Grok, el 67,1% de las conversaciones incluye búsqueda de información, contra 26,2% en WildChat. ShareGPT se inclina a generación de contenido (63,6%) y AI Archive a análisis de información (53,9%). Los temas se separan igual: Grok concentra noticias y actualidad (38,5%) y negocios y sociedad (64,5%), muy por encima del resto. Y la estructura tampoco coincide: los prompts de WildChat promedian 569,5 tokens frente a un rango de 51,8 a 181,0 en las demás, y las respuestas de Grok promedian 1.322,9 tokens.</p>

<p>Eso importa sobre todo para los riesgos. Los problemas de integridad académica, por ejemplo tareas probablemente copiadas, van de 23,1% en WildChat a 40,4% en AI Archive. La desinformación se concentra en Grok (15,3%, frente a un rango de 4,2% a 10,2% en el resto). Los autores son cuidadosos con la interpretación: como todas las fuentes son de participación voluntaria, no pueden atribuir ninguna diferencia a una causa concreta, sea la plataforma, el modelo o el período. Lo que sí queda establecido es la magnitud. De qué fuente se saquen los datos cambia sustantivamente el retrato del uso.</p>

<p>El segundo hallazgo es el que da el título, y es el más incómodo. El Índice Económico de Anthropic, en su versión de marzo de 2025, primero filtra las conversaciones relevantes para alguna ocupación y solo después mapea las tareas. Los autores reimplementaron ese filtro a partir de los prompts y la taxonomía que Anthropic publicó, y lo corrieron sobre seis de sus siete fuentes: el National Internet Observatory queda afuera porque su acuerdo de datos solo permite sacar anotaciones agregadas acordadas de antemano, así que el pipeline no puede correrse ahí. El 47,9% de las conversaciones queda clasificado como no ocupacional, con un piso de 34,2% en AI Archive y un techo de 61,9% en LMSYS. Después miraron qué es lo que el filtro descarta, manteniendo fija la fuente y la anotación. Lo descartado no es residuo aleatorio: es mucho más probable que involucre salud y relaciones (44,2% contra 31,2%), temas adultos o ilícitos (7,9% contra 2,1%), acoso u odio (27,5% contra 5,6%) y contenido sexual (15,7% contra 2,4%). La conclusión que sacan es de método, no de acusación: el filtro no es un paso neutro de preprocesamiento, y un marco puede parecer completo mientras deja fuera de forma sistemática usos socialmente importantes. Ellos mismos aclaran dos cosas que conviene no saltarse. Ese 47,9% no es una estimación del tráfico de Claude.ai, y las versiones posteriores del Índice ya no aplican el filtro ocupacional y encuentran distribuciones parecidas.</p>

<p>El tercero es que el uso se mueve. Entre abril de 2023 y julio de 2025, dentro de WildChat, los prompts crecieron 1.049,5% en tokens promedio, las respuestas 100,6% y los turnos 17,1%. Y las variantes de un mismo desarrollador sostienen regímenes de uso distintos: intercambios cortos y de plantilla con GPT-3.5, asistencia más larga e iterativa con GPT-4o, y resolución técnica larga de una sola pasada con modelos de razonamiento como o1.</p>

<p>El cuarto mira a las personas y no a los promedios. Entre los usuarios que vuelven a WildChat, la variedad de usos se angosta con el tiempo: las etiquetas de función distintas bajan de 4 a 3 y las de uso sensible de 2 a 1. O sea, la expansión agregada de las conversaciones no viene de que cada usuario escriba más, sino de que cambia quién está usando la herramienta.</p>

<h2 id="segunda-lectura-desde-américa-latina">Segunda lectura: desde América Latina</h2>

<p>La región no aparece en este trabajo, y los autores lo dicen: entre las limitaciones declaran que las regiones donde predomina el Sur Global siguen mayormente fuera de alcance, aunque estén algo representadas, y proponen como remedio integrar estudios de donación consentida, muestreo regional y agregados del lado de los proveedores. La taxonomía detecta 72 idiomas, pero el paper no reporta ningún corte por lengua en su cuerpo principal.</p>

<p>Aun así, el resultado central se traduce directo. Cuando en la región se discute qué hacer con la IA, las cifras que se citan casi siempre vienen de dos o tres reportes de las propias empresas. Lo que este paper agrega es una advertencia sobre cómo se leen: la elección de la fuente y la elección del filtro no son detalles técnicos, son decisiones que cambian el resultado antes de que empiece el análisis. Una política de IA para el trabajo apoyada en un marco ocupacional no está midiendo mal, está midiendo una parte, y esa parte deja afuera justo lo que le tocaría a salud, educación o protección de datos.</p>

<p>Hay una diferencia de posición que vale marcar, y es mía, no del paper. Estados Unidos y Europa pueden compensar la opacidad de los reportes corporativos con mediciones propias: encuestas, observatorios instrumentados, acceso negociado a datos. Un país mediano de la región casi nunca tiene ninguna de esas tres cosas, así que depende más del reporte ajeno y tiene menos con qué contrastarlo. Lo que este trabajo muestra es que ese contraste no requiere acceso privilegiado a los servidores de nadie: requiere conversaciones donadas con consentimiento, una taxonomía explícita y dinero para anotar. El costo total de anotación que reportan es de 5.680 dólares. Para una agencia pública o un centro universitario de la región, ese número no es la barrera.</p>

<p>Queda entonces una pregunta práctica. La taxonomía y las herramientas de anotación están publicadas y son extensibles, y el propio paper reconoce que su cobertura del Sur Global es débil. ¿Quién en la región va a poner las conversaciones en español y en portugués que hoy no están en ningún observatorio?</p>

<h2 id="la-letra-chica">La letra chica</h2>

<ul>
  <li>Ninguna de las siete fuentes es representativa del uso de IA. Todas son de participación voluntaria, y los propios autores sospechan que los usos sensibles están subrepresentados, porque la gente no comparte públicamente ese tipo de conversación.</li>
  <li>Las etiquetas las pone un modelo. El acuerdo con el consenso humano tiene una mediana de F1 de 0,856 por categoría madre, y por eso todas las comparaciones del cuerpo se hacen a ese nivel. Los autores señalan que “usos sensibles” es la familia menos estable, y piden leer esas prevalencias como aproximadas.</li>
  <li>El set de validación lo produjeron los mismos autores que diseñaron la taxonomía y eligieron el pipeline. Ellos lo dicen: eso evidencia la fidelidad del pipeline a su propio esquema, no la validez del esquema.</li>
  <li>El análisis temporal y el de perfiles de usuario se apoyan solo en WildChat, la única fuente con marcas de tiempo multianuales e identificadores estables.</li>
  <li>Es un preprint sin revisión por pares. Varios autores tienen afiliación en laboratorios de IA, y el trabajo compara su medición contra un reporte propietario de otro laboratorio; ellos mismos advierten que las diferencias pueden deberse a una mezcla de cambios de producto, de período y de fuente.</li>
</ul>]]></content><author><name>Doble Click</name></author><category term="datos" /><category term="gobernanza" /><category term="seguridad" /><summary type="html"><![CDATA[Un consorcio académico juntó siete fuentes de conversaciones reales con asistentes de IA y las anotó con una misma taxonomía. Al aplicarles el filtro ocupacional del Índice Económico de Anthropic, el 48% de las conversaciones queda descartado, y lo descartado no es ruido: ahí se concentran la salud, los vínculos y buena parte del contenido sensible.]]></summary></entry><entry><title type="html">Los libros con IA venden poco cada uno, pero bajan lo que gana cada título</title><link href="https://dobleclick.jaguridi.cl/doble-lectura/ia-diluye-mercado-libros/" rel="alternate" type="text/html" title="Los libros con IA venden poco cada uno, pero bajan lo que gana cada título" /><published>2026-08-17T00:00:00-04:00</published><updated>2026-08-17T00:00:00-04:00</updated><id>https://dobleclick.jaguridi.cl/doble-lectura/ia-diluye-mercado-libros</id><content type="html" xml:base="https://dobleclick.jaguridi.cl/doble-lectura/ia-diluye-mercado-libros/"><![CDATA[<h2 id="la-ficha">La ficha</h2>

<ul>
  <li><strong>Qué es:</strong> <em>Generative AI floods and dilutes the market for books</em></li>
  <li><strong>Quiénes:</strong> <a href="https://scholar.google.com/scholar?q=%22Tuhin+Chakrabarty%22">Tuhin Chakrabarty</a> y <a href="https://scholar.google.com/scholar?q=%22Xinyue+Liu%22+Stony+Brook">Xinyue Liu</a> (Stony Brook University), <a href="https://scholar.google.com/scholar?q=%22Jane+C.+Ginsburg%22">Jane C. Ginsburg</a> (Columbia Law School) y <a href="https://scholar.google.com/scholar?q=%22Paramveer+Dhillon%22">Paramveer Dhillon</a> (University of Michigan y MIT Initiative on the Digital Economy).</li>
  <li><strong>Dónde:</strong> preprint en arXiv, versión del 26 de julio de 2026. Sin revisión por pares al momento de esta lectura. <a href="https://doi.org/10.48550/arXiv.2607.20349">doi.org/10.48550/arXiv.2607.20349</a></li>
  <li><strong>Tipo:</strong> estudio observacional de mercado. 14.419 e-books de ficción de género autopublicados en Amazon entre enero de 2023 y marzo de 2026, con ventas diarias hasta junio de 2026 y detección de IA sobre el texto completo de cada libro.</li>
</ul>

<h2 id="primera-lectura-qué-hace-y-qué-encuentra">Primera lectura: qué hace y qué encuentra</h2>

<p>El punto de partida es una creencia extendida: los libros escritos con IA son <em>slop</em>, texto barato que los lectores van a ignorar, así que da lo mismo cuántos haya. Los autores separan dos cosas que ese argumento junta. Que la calidad promedio sea baja no significa que el efecto sobre el mercado sea nulo, porque un libro que cuesta casi nada producir se puede producir de a cientos, y a ese volumen incluso un producto mediocre absorbe atención y ventas que iban a ir a otra parte.</p>

<p>Para medirlo armaron un panel poco común. Las ventas diarias, el precio y el ranking vienen de una base propietaria de una de las cinco grandes editoriales, que cubre alrededor del 95% del volumen diario del mercado de e-books. De ahí sacaron una muestra estratificada por género y por fecha, elegida a ciegas respecto del contenido, y clasificaron cada libro con el detector Pangram, capítulo por capítulo. El puntaje es el porcentaje de ventanas de texto marcadas como no escritas por humanos, y con eso arman tres bandas: sin IA detectada, IA leve (hasta 25%) e IA sustancial (sobre 25%).</p>

<p>El primer hallazgo desinfla el pánico. Los libros con IA sustancial aparecen en los ocho grupos de género, pero venden mal: son el 20% de la muestra y apenas el 12,1% de las ventas, mientras los sin IA detectada son el 62,9% de los títulos y se llevan el 71,7%. El segundo va en la dirección contraria: igual no se quedaron en el fondo. Su participación en las ventas pasó de casi cero a comienzos de 2023 a cerca del 20% a mediados de 2026, y entre los títulos nuevos que entran al Top 25 que construyen los autores, la proporción con IA sustancial subió de casi cero a 31%.</p>

<p>El tercero es el que da el título del paper. Entre principios de 2023 y principios de 2026, el catálogo acumulado de títulos publicados creció 38,3 veces y la cantidad de libros que vendían algo en un trimestre creció 19,2 veces, mientras las unidades vendidas crecieron 7,3 veces y los ingresos 8,9. El mercado sumó libros mucho más rápido de lo que sumó dinero, así que lo que gana cada título cayó. Comparando la cohorte de lanzamiento de 2023 con la de 2025 en una ventana fija de 90 días, los ingresos por libro bajaron en seis de los ocho géneros. Y la caída también aparece si se miran solo los libros sin IA detectada: ahí bajaron en siete de ocho. Por eso los autores descartan un efecto de composición, esa cosa aritmética donde el promedio baja solo porque entraron muchos títulos que venden poco.</p>

<p>El cuarto cierra el argumento: las pérdidas se concentran donde hay más IA. En los meses y géneros de menor exposición, los libros sin IA detectada ocupan cerca del 88% de las posiciones Top 25; en los de mayor exposición, cerca del 63%. La caída es más pronunciada donde hay más Kindle Unlimited, porque ahí los lectores sacan de un mismo pozo de suscripción y cada título nuevo compite por los mismos préstamos. Y en el género al que la IA llegó más tarde y menos, fantasía, sobrenatural y terror, los ingresos por libro de los títulos sin IA detectada subieron 35%.</p>

<p>Dos piezas más, una por cada lado del mercado. De las 385 firmas que siguieron publicando libros con IA sustancial, 287 aumentaron su producción mensual, y la que más facturó generó 1,7 millones de dólares brutos con ocho títulos. Y entre los más vendidos, los libros con IA sustancial están más saturados de expresiones raras que ya aparecen en libros existentes: 45% de cobertura en el Top 50, contra 37,7% de los sin IA detectada, con brechas parecidas en el Top 100 y el Top 200. Contra un tercer grupo de comparación, 200 libros de ficción premiada, la distancia es mayor: 19,1% frente a 41,6% de los con IA sustancial y 37,2% de los sin IA detectada.</p>

<h2 id="segunda-lectura-desde-américa-latina">Segunda lectura: desde América Latina</h2>

<p>Conviene decirlo de entrada: el paper no mira la región. Es un mercado en inglés, en una plataforma, en un segmento. Lo que viaja es el mecanismo, y los propios autores lo dicen: las condiciones que hicieron vulnerable a este mercado no son exclusivas suyas. Costos de entrada casi nulos, lectores que vuelven por lo mismo, descubrimiento por un pozo compartido de rankings donde lo humano y lo sintético compiten de igual a igual, y cero obligación de declarar cómo se produjo la obra. Donde eso se cumpla esperan lo mismo, y nombran música, bancos de imágenes y escritura corta.</p>

<p>De ahí sale la lectura regional más útil, que es mía y no del paper: si el daño depende de la relación entre títulos nuevos y dinero disponible, los mercados chicos son más frágiles, no menos. La ficción de género en español mueve un pozo de ingresos mucho menor que el estadounidense, y en un pozo menor se necesitan muchos menos títulos para producir la misma dilución. No hay dato en el paper sobre esto y lo dejo como hipótesis. Pero la asimetría es difícil de esquivar: producir es barato en cualquier idioma, y lo que cambia entre mercados es cuánto hay para repartir.</p>

<p>Lo segundo es qué palanca queda a mano. Buena parte del artículo está construida para una pregunta legal estadounidense, el efecto sobre el mercado como criterio del <em>fair use</em>, y para la teoría de la dilución que el juez Chhabria dejó planteada en <em>Kadrey contra Meta</em> diciendo que faltaba justamente la evidencia que este paper produce. Esa doctrina no existe en los sistemas de derecho de autor de la región, que funcionan con listas cerradas de excepciones: el hallazgo económico cruza la frontera, el vehículo jurídico no. Lo que sí se puede discutir acá es la divulgación, porque ninguno de estos libros declara si contiene texto de IA. Los autores especulan con que esa opacidad da ventaja y aclaran que no tienen datos para afirmarlo, pero es la única condición de la lista que se puede cambiar sin esperar el fallo de fondo sobre entrenamiento.</p>

<p>Y hay algo que el paper deja servido para cualquier discusión regional sobre remuneración a autores: la evidencia acá no es sobre calidad, es sobre volumen. Los libros con IA venden mal uno por uno y aun así corren la aguja, lo que sugiere que confiar en que el público distinga lo bueno de lo malo no alcanza para proteger el ingreso de quien escribe. La pregunta que queda es práctica: si el mecanismo es la escala, ¿qué instrumento tiene un país mediano para que sus autores no terminen compitiendo con una oferta infinita en el mismo estante?</p>

<h2 id="la-letra-chica">La letra chica</h2>

<ul>
  <li>Las comparaciones son observacionales y asociativas, y los autores lo declaran: comparan cohortes y relacionan resultados con exposición por género, no estiman un efecto causal.</li>
  <li>Todo descansa en un detector. Un libro está “sin IA detectada” según Pangram 3.3, no según su autor, y las tasas de error reportadas vienen del propio proveedor. Los autores sí muestran que los resultados aguantan mover el umbral de 25%.</li>
  <li>El panel de ventas lo proveyó una de las cinco grandes editoriales, parte interesada en el debate de derechos de autor. El análisis es de los investigadores, pero el dato viene de un actor con posición tomada.</li>
  <li>La identidad de autor sale de la firma del libro, así que quien publica bajo varios seudónimos aparece dividido: la concentración reportada es un piso.</li>
  <li>Los autores anotan que el efecto neto sobre el bienestar queda abierto, porque los lectores pueden ganar con más variedad y precios más bajos. Lo que miden es la pérdida para quien escribe.</li>
  <li>La superposición de expresiones raras es agregada: muestra parecido con el lenguaje distintivo de libros existentes, no copia de ninguno en particular.</li>
</ul>]]></content><author><name>Doble Click</name></author><category term="mercados" /><category term="trabajo" /><category term="gobernanza" /><summary type="html"><![CDATA[Casi 14.500 novelas autopublicadas en Amazon, con detección de IA sobre el texto completo y ventas diarias reales. Los libros con IA sustancial son el 20% del catálogo y apenas el 12% de las ventas, pero el catálogo creció mucho más rápido que el dinero disponible, y los libros sin IA detectada también ganan menos que antes.]]></summary></entry><entry><title type="html">La IA ya llegó a casi todos los oficios, pero apenas cubre una quinta parte de sus tareas</title><link href="https://dobleclick.jaguridi.cl/doble-lectura/atlas-google-uso-ia-economia/" rel="alternate" type="text/html" title="La IA ya llegó a casi todos los oficios, pero apenas cubre una quinta parte de sus tareas" /><published>2026-08-10T00:00:00-04:00</published><updated>2026-08-10T00:00:00-04:00</updated><id>https://dobleclick.jaguridi.cl/doble-lectura/atlas-google-uso-ia-economia</id><content type="html" xml:base="https://dobleclick.jaguridi.cl/doble-lectura/atlas-google-uso-ia-economia/"><![CDATA[<h2 id="la-ficha">La ficha</h2>

<ul>
  <li><strong>Qué es:</strong> <em>Google’s AI &amp; Economy ATLAS v1.0: Mapping Gemini Usage in the Economy</em>, primera entrega de una iniciativa de investigación económica de Google sobre sus propios registros de uso.</li>
  <li><strong>Quiénes:</strong> dieciocho personas de Google y Google DeepMind. La correspondencia queda a nombre de <a href="https://scholar.google.com/scholar?q=%22Zanna+Iscenko%22">Zanna Iscenko</a> y <a href="https://scholar.google.com/scholar?q=%22Scott+Strand%22+Google">Scott Strand</a>. Los agradecimientos consignan contribuciones, orientación y revisión de Diane Coyle (Universidad de Cambridge) y David Autor (MIT).</li>
  <li><strong>Dónde:</strong> publicado por Google el 23 de julio de 2026 y depositado como preprint en arXiv. Sin revisión por pares: es un reporte de la propia empresa sobre su propio producto. <a href="https://doi.org/10.48550/arXiv.2608.00038">doi.org/10.48550/arXiv.2608.00038</a></li>
  <li><strong>Tipo:</strong> estudio observacional. 14.653.926 interacciones desidentificadas entre el 6 y el 19 de abril de 2026, en la app de Gemini, el Modo IA de Google y la API de Gemini, clasificadas y mapeadas de forma automática a taxonomías estadísticas oficiales de Estados Unidos.</li>
</ul>

<h2 id="primera-lectura-qué-hace-y-qué-encuentra">Primera lectura: qué hace y qué encuentra</h2>

<p>Conviene partir por qué tipo de trabajo es esto. No es un experimento ni una estimación causal: es un ejercicio de medición. Los autores resumen conversaciones reales con Gemini, las agrupan en clusters y mapean cada grupo contra tres marcos que ya existían: la clasificación de ocupaciones de la Oficina de Estadísticas Laborales de Estados Unidos, el catálogo de tareas O*NET y la encuesta de uso del tiempo ATUS. La gracia del diseño está ahí, en pegar el uso de IA a las mismas categorías con que se mide la economía.</p>

<p>Los dos primeros hallazgos hay que leerlos juntos, porque el segundo corrige al primero. La IA aparece en el 68% de las ocupaciones, que concentran algo más del 88% del empleo estadounidense, y no solo en las de siempre: junto a desarrolladores y analistas de mercado aparecen agricultores, ingenieros industriales e ingenieros forestales. Pero la penetración es ancha y delgada. En la ocupación mediana con algo de uso, la IA cubre el 21% de las tareas que componen ese oficio, y solo un 3% de las ocupaciones supera los tres cuartos.</p>

<p>El tercero es sobre qué se le pide a la herramienta. Las tareas cognitivas no rutinarias, esas que la literatura clásica consideraba complementarias a la tecnología y no sustituibles, son cerca del 35% de las tareas de la economía y casi el 65% de las interacciones de trabajo en estos datos. Pero un clasificador de intención muestra que ese uso se concentra en generar borradores parciales, revisar y afinar, discutir ideas y buscar información. Que la IA ejecute la tarea completa de punta a punta aparece en menos del 10% de esas conversaciones; en el trabajo cognitivo rutinario, en cambio, más de un cuarto apunta a automatizar. Los autores marcan que este clasificador es preliminar.</p>

<p>Dos hallazgos más, en direcciones opuestas. La IA también aparece en el trabajo manual: en varios oficios técnicos funciona como acompañante de diagnóstico, y ahí el uso con imágenes y video más que duplica la línea base del resto del trabajo. Al mismo tiempo, el uso escala con el sueldo: un 1% más de ingreso mediano en una ocupación se asocia a más de un 2,5% más de intensidad de uso, y la relación sobrevive al controlar por nivel educativo.</p>

<p>Fuera del trabajo pasa lo que casi nadie mide: más del 86% del uso conversacional, el que no pasa por la API, ocurre ahí, y se concentran en trámites de alta fricción. Las consultas sobre servicios de gobierno y obligaciones cívicas están sobrerrepresentadas por un factor cercano a veinte respecto del tiempo que la gente les dedica, y casi la mitad de las consultas médicas, legales, financieras y de gobierno ocurren fuera del horario hábil. La imagen que proponen es la de una oficina pública abierta de noche y los fines de semana. Sobre eso estiman el valor que el PIB no captura: entre 15 y 149 mil millones de dólares anuales solo en Estados Unidos, según supuestos de ahorro de tiempo entre 0,5% y 5%. Es una cuenta hipotética y lo dicen con todas sus letras.</p>

<h2 id="segunda-lectura-desde-américa-latina">Segunda lectura: desde América Latina</h2>

<p>Lo primero es que la región aparece, y aparece bien. La adopción por habitante sigue de cerca la riqueza nacional, con una elasticidad cercana a 0,9, pero Chile, Perú, Brasil, Argentina y Colombia se ubican en los quintiles alto y muy alto de uso conversacional, junto a países bastante más ricos. Los autores lo atribuyen en parte al uso extendido de dispositivos digitales y dejan abierta la pregunta de por qué algunos países de ingreso medio se salen de la línea.</p>

<p>Lo segundo es más incómodo. Cuando el uso laboral se mide como porcentaje de las conversaciones totales de cada país, y no en volumen por habitante, el ranking se da vuelta: Estados Unidos y la Unión Europea caen a los quintiles bajos, África salta al más alto y Sudamérica se mantiene arriba. Los autores ofrecen la lectura entusiasta, profesionales de economías en desarrollo usando la IA para sortear restricciones que en otros lados no existen, pero la contrapesan de inmediato. Donde los datos móviles se pagan por megabyte el uso digital tiende a ser más dirigido a un fin, así que hay menos conversación casual diluyendo el denominador. Y el conjunto de datos no incluye las cuentas empresariales de Gemini: si esas suscripciones corporativas son más habituales en Norteamérica y Europa, como plantean los autores, el uso profesional de esos países queda subestimado.</p>

<p>Lo tercero es una buena noticia bien fundada, y tiene que ver con el idioma. El español es la segunda lengua del conjunto de datos, con 12% de las conversaciones, detrás de un inglés que solo llega a un tercio; el portugués ronda el 6%. Y la hipótesis de que la gente se cambia al inglés para lo importante no se sostiene: el uso de una lengua no primaria es del 26% en actividades de trabajo y de casi 24% fuera del trabajo. Eso sí, esas conversaciones salen más caras, entre 9% y 12% más turnos y entre 18% y 20% más tokens, así que los autores concluyen que invertir en calidad multilingüe rinde también en eficiencia.</p>

<p>Lo cuarto es la advertencia: usar IA no es lo mismo que construir con IA. El mapa de la API está todavía más concentrado en países de ingreso alto, porque integrar una API exige ingeniería, infraestructura y capital, se paga por token, y los idiomas fuera del alfabeto occidental consumen más tokens por palabra. Ahí conviene ser fiel a lo que el reporte declara: los países del quintil más bajo de uso conversacional concentran el 17% de la población mundial y generan el 2% de las conversaciones, y los autores aclaran de forma explícita que ATLAS v1.0 no permite pronunciarse sobre si la IA profundiza esa brecha.</p>

<p>La pregunta que queda para la región es cuál de las dos historias es la verdadera: si el alto uso laboral que muestran estos datos es un multiplicador de productividad, o el efecto óptico de un uso más escaso y más obligado. Esa distinción vale mucho para cualquier política pública, y con estos datos no se puede hacer.</p>

<h2 id="la-letra-chica">La letra chica</h2>

<ul>
  <li>Es un reporte de Google sobre el uso de Gemini, publicado por Google y sin revisión por pares: evidencia interna con acceso a datos que nadie más tiene, no una auditoría independiente. La revisión externa de Coyle y Autor ayuda, pero no cambia la naturaleza del documento.</li>
  <li>Mide comportamiento, no resultados. Que una conversación termine no significa que la persona haya logrado su objetivo ni ahorrado tiempo. Es la segunda limitación que declaran, después de la falta de datos empresariales.</li>
  <li>Falta buena parte del uso profesional: no incluye la API pagada ni el uso empresarial vía Google Cloud, ni Workspace, Translate, AI Overviews o programación agéntica.</li>
  <li>Las clasificaciones son probabilísticas y los clasificadores de intención y experticia son preliminares. La cifra de valor doméstico depende de un ahorro de tiempo supuesto, no medido. Todo es una foto de dos semanas de abril de 2026.</li>
</ul>]]></content><author><name>Doble Click</name></author><category term="trabajo" /><category term="mercados" /><category term="latam" /><summary type="html"><![CDATA[Google mapeó 15 millones de conversaciones con Gemini contra las taxonomías oficiales de ocupaciones y tareas de Estados Unidos. La adopción alcanza al 68% de las ocupaciones, pero en la ocupación mediana llega al 21% de sus tareas, y menos del 10% del uso en trabajo cognitivo no rutinario busca que la IA haga la tarea completa.]]></summary></entry><entry><title type="html">Los gobiernos ya usan IA generativa, pero casi ninguno mide si funciona</title><link href="https://dobleclick.jaguridi.cl/doble-lectura/ocde-experimentacion-ia-gobierno/" rel="alternate" type="text/html" title="Los gobiernos ya usan IA generativa, pero casi ninguno mide si funciona" /><published>2026-08-03T00:00:00-04:00</published><updated>2026-08-03T00:00:00-04:00</updated><id>https://dobleclick.jaguridi.cl/doble-lectura/ocde-experimentacion-ia-gobierno</id><content type="html" xml:base="https://dobleclick.jaguridi.cl/doble-lectura/ocde-experimentacion-ia-gobierno/"><![CDATA[<h2 id="la-ficha">La ficha</h2>

<ul>
  <li><strong>Qué es:</strong> <em>Generative AI experimentation in government: Learning from emerging guidelines</em></li>
  <li><strong>Quiénes:</strong> <a href="https://www.oecd.org/en/about/people/piret-tonurist.html">Piret Tõnurist</a>, de la Dirección de Gobernanza Pública de la OCDE, y Moritz von Knebel, consultor externo. El trabajo fue cofinanciado por la Unión Europea.</li>
  <li><strong>Dónde:</strong> <em>OECD Working Papers on Public Governance</em> No. 93, 2026. <a href="https://doi.org/10.1787/42815683-en">doi.org/10.1787/42815683-en</a></li>
  <li><strong>Tipo:</strong> revisión sistemática de guías oficiales de gobierno, complementada con literatura académica y estudios de caso. No es un experimento ni una medición de impacto.</li>
</ul>

<h2 id="primera-lectura-qué-hace-y-qué-encuentra">Primera lectura: qué hace y qué encuentra</h2>

<p>El punto de partida del documento es un hecho que cualquiera que trabaje en el Estado reconoce: los funcionarios ya están usando IA generativa, muchas veces sin aprobación formal ni supervisión clara. Entre esa adopción rápida y descentralizada, y los mecanismos de gobernanza que van bastante más lento, se abrió una brecha. El trabajo se mete ahí, y elige un ángulo específico: no mira el despliegue a gran escala sino la experimentación, entendida como la etapa donde un gobierno prueba, aprende y decide si corresponde escalar.</p>

<p>El método es una revisión de las guías oficiales que los gobiernos ya publicaron sobre el tema. El texto reporta catorce países: Australia, Canadá, Finlandia, Irlanda, Italia, Japón, Nueva Zelanda, Noruega, Suecia, Suiza, Países Bajos, Reino Unido, Estados Unidos y Singapur. El anexo, que lista los documentos uno por uno, agrega además a Emiratos Árabes Unidos y a Corea, y da una idea del universo: Reino Unido aparece con siete guías distintas y Australia con siete.</p>

<p>El primer hallazgo es de forma. Las guías existen y son abundantes, pero están fragmentadas y son muy desparejas entre sí. Van desde declaraciones generales de valores hasta manuales detallados con listas de verificación. Muchos gobiernos publicaron principios de alto nivel sobre uso ético o responsable, y bastante poca orientación operativa sobre cómo diseñar, correr y juzgar un experimento concreto. La consecuencia que señalan los autores no es la que uno esperaría: esa disparidad no produce libertad, produce incertidumbre, y la incertidumbre produce aversión al riesgo o prácticas inconsistentes entre reparticiones e incluso dentro de una misma. La falta de herramientas compartidas también multiplica la duplicación, porque cada equipo reinventa lo que otro ya probó.</p>

<p>El segundo hallazgo es el que da el título, y es más incómodo. El monitoreo y la evaluación son la debilidad crítica. Pocos gobiernos verifican de forma sistemática si un experimento entregó los beneficios que prometía, si generó riesgos nuevos o si justifica escalar. Cuando hay evaluación, suele apoyarse en indicadores básicos como uso o satisfacción del usuario, y no en mediciones estructuradas de desempeño, impacto, costo y cumplimiento. Los autores agregan un punto técnico que vuelve esto más serio: como estos sistemas son probabilísticos y el mismo pedido puede dar resultados distintos, evaluarlos exige auditar salidas, no basta con revisar el diseño una vez. Sin criterios acordados ni métricas comparables, un gobierno no tiene cómo cerrar un experimento que fracasó ni cómo priorizar en qué invertir después.</p>

<p>De ahí sale la propuesta del documento: un marco para evaluar experimentos de IA generativa en cinco áreas, que son el desempeño del piloto y la calidad de lo que entra y sale, el impacto proyectado y el valor público, el costo y la factibilidad de integrarlo a la institución, la usabilidad y aceptabilidad, y la gestión de riesgos y el cumplimiento. El cierre es una lista de diez acciones prioritarias, entre ellas construir confianza pública en los experimentos, formar a los funcionarios, evitar que los proyectos queden fragmentados, invertir en herramientas y datos compartidos, y planificar la evaluación desde el principio y no al final.</p>

<h2 id="segunda-lectura-desde-américa-latina">Segunda lectura: desde América Latina</h2>

<p>El dato más elocuente para la región no está en los hallazgos sino en el anexo: entre los países cuyas guías se revisaron no hay ninguno de América Latina. La lista es de países de altos ingresos, con Reino Unido, Australia, Canadá y los nórdicos concentrando la mayor parte de los documentos. Esto no es un reproche a los autores, que revisan lo que existe y está publicado, pero sí define qué es este trabajo para un lector de la región: es un mapa de lo que hicieron otros, no un diagnóstico de lo propio.</p>

<p>Eso deja dos lecturas posibles y conviene no confundirlas. La primera es de oportunidad. Si el hallazgo central es que incluso los países con más recursos publicaron principios y se quedaron cortos en evaluación, entonces un país de la región que hoy está escribiendo su guía puede saltarse esa etapa y partir con el marco de evaluación incorporado. Es más barato hacerlo al principio que agregarlo después, y el documento entrega las cinco áreas ya ordenadas.</p>

<p>La segunda es de advertencia, y es mía más que del paper. El diagnóstico de fondo, funcionarios usando estas herramientas sin aprobación formal ni supervisión, no requiere una guía nacional para ocurrir: ocurre igual, y probablemente ocurre más donde hay menos capacidad de fiscalización. Lo que cambia sin guía no es el uso, es la visibilidad del uso. Vale conectarlo con algo que ya vimos en la región: cuando ChileCompra anuncia modelos de lenguaje para detectar irregularidades en compras públicas, la pregunta que el marco de la OCDE haría primero no es si el modelo funciona, sino con qué criterios se va a medir si funcionó y qué recurso tiene alguien marcado por error.</p>

<p>Una prudencia final sobre qué tipo de evidencia es esta. Es una revisión de documentos, no una medición. Dice qué dicen las guías y qué les falta. No dice si los países que evalúan mejor obtienen mejores resultados, porque no lo estudió. El marco de cinco áreas es una propuesta razonada de la OCDE, no un instrumento validado empíricamente.</p>

<h2 id="la-letra-chica">La letra chica</h2>

<ul>
  <li>Es una revisión de guías oficiales publicadas, así que hereda el sesgo de lo que está escrito y en inglés. Un país puede tener prácticas de evaluación sin haberlas publicado como guía, y no aparecería aquí.</li>
  <li>Los propios autores aclaran en las notas que su tabla principal solo recoge países cuyos documentos declaran principios de forma explícita, y que algunos casos, como Estados Unidos, emitieron orientación para agencias específicas o a nivel estatal que no queda representada.</li>
  <li>El marco de evaluación en cinco áreas es una propuesta del documento, no un estándar acordado ni algo que se haya probado en terreno.</li>
  <li>El trabajo fue cofinanciado por la Unión Europea. La propia publicación aclara que su contenido es responsabilidad exclusiva de la OCDE y no refleja necesariamente la posición de la Unión Europea. Vale tenerlo a la vista al leer un documento que evalúa guías de gobierno, varias de ellas de Estados miembros.</li>
</ul>]]></content><author><name>Doble Click</name></author><category term="gobernanza" /><category term="participación" /><summary type="html"><![CDATA[La OCDE revisó las guías oficiales de catorce países y encontró que casi todas dicen cómo usar IA con responsabilidad y casi ninguna dice cómo evaluar si el experimento sirvió. En la lista de países revisados no hay ninguno de América Latina.]]></summary></entry><entry><title type="html">Anthropic aprende a leer lo que sus modelos están por decir</title><link href="https://dobleclick.jaguridi.cl/doble-lectura/espacio-trabajo-global-modelos/" rel="alternate" type="text/html" title="Anthropic aprende a leer lo que sus modelos están por decir" /><published>2026-08-03T00:00:00-04:00</published><updated>2026-08-03T00:00:00-04:00</updated><id>https://dobleclick.jaguridi.cl/doble-lectura/espacio-trabajo-global-modelos</id><content type="html" xml:base="https://dobleclick.jaguridi.cl/doble-lectura/espacio-trabajo-global-modelos/"><![CDATA[<h2 id="la-ficha">La ficha</h2>

<ul>
  <li><strong>Qué es:</strong> <em>Verbalizable Representations Form a Global Workspace in Language Models</em></li>
  <li><strong>Quiénes:</strong> un equipo de dieciséis personas del área de interpretabilidad de Anthropic. Figuran como contribuyentes principales Wes Gurnee, Nicholas Sofroniew y Jack Lindsey, y la correspondencia queda a nombre de Lindsey.</li>
  <li><strong>Dónde:</strong> <em>Transformer Circuits Thread</em>, publicación propia de Anthropic, 6 de julio de 2026. <a href="https://transformer-circuits.pub/2026/workspace/index.html">transformer-circuits.pub</a></li>
  <li><strong>Tipo:</strong> trabajo de interpretabilidad. Propone un método nuevo y lo aplica a modelos de producción ya entrenados.</li>
</ul>

<h2 id="primera-lectura-qué-hace-y-qué-encuentra">Primera lectura: qué hace y qué encuentra</h2>

<p>El punto de partida es una analogía que conviene manejar con cuidado. En las personas, solo una fracción de lo que procesa el cerebro queda disponible para pensar de forma deliberada y para poner en palabras. El resto ocurre en automático. La neurociencia llama a esto acceso consciente, y una de las teorías que lo explica, la del espacio de trabajo global, propone que existe una especie de pizarra compartida: muchos procesos especializados corren en paralelo y aislados, y un contenido se vuelve accesible cuando se publica en esa pizarra, desde donde muchos otros procesos pueden leerlo.</p>

<p>La pregunta del trabajo es si algo funcionalmente parecido apareció en los modelos de lenguaje. La respuesta que da es que sí. Los autores sostienen que los modelos mantienen un conjunto privilegiado de representaciones internas, disponibles para ser reportadas, moduladas y usadas en razonamiento flexible, sobre un volumen mucho mayor de procesamiento que corre solo.</p>

<p>El aporte concreto no es la analogía sino el instrumento. El trabajo introduce lo que llama una lente jacobiana: para cada token del vocabulario calcula la dirección que, en promedio a través de contextos, predispone al modelo a decir ese token. Leer esa lente en un punto del procesamiento devuelve la lista de conceptos que el modelo está en condiciones de verbalizar ahí. Es una forma de mirar el borrador antes de que se convierta en respuesta.</p>

<p>Con ese instrumento aparecen varios hallazgos. El espacio de trabajo vive en capas intermedias: en aproximadamente el primer tercio de la profundidad del modelo las lecturas son ruidosas y en su mayoría ininterpretables, y en las últimas capas la cosa cambia de naturaleza y pasa a representar lo que el modelo está por emitir, más que sus cálculos intermedios. También es selectivo, y esto es lo más interesante: el espacio se activa cuando un resultado intermedio tiene que entregarse a un circuito posterior arbitrario, definido por el contexto, y se saltea cuando el cálculo es automático. Es decir, el modelo usa la pizarra cuando no sabe de antemano quién va a leer lo que escribe. Además, al comparar un modelo post-entrenado con su modelo base se ve qué le hace el entrenamiento posterior al contenido de la pizarra: el espacio adopta el punto de vista del asistente, y aparecen reacciones propias de ese rol, como empatía o preocupación por la seguridad, mientras el modelo todavía está leyendo el mensaje del usuario.</p>

<p>La parte que más va a circular es la de alineamiento. Al aplicar la lente a escenarios de evaluación, las valoraciones estratégicas y situacionales del modelo aparecieron en ese espacio incluso cuando no estaban visibles en su salida, o antes de estarlo. También aparece ahí, a veces, el reconocimiento de estar dentro de una evaluación. Y en dos modelos entrenados a propósito para comportarse de forma desalineada, la lente dejó ver la firma interna de esa disposición: en uno entrenado para complacer los sesgos de los modelos de recompensa asoman “recompensa” y “sesgo”; en otro dispuesto a escribir código malicioso, “en secreto” y “engañar”. Leer la lente no exige entrenar nada adicional y produce texto que una persona puede leer, aunque construirla sí tiene un costo previo: los jacobianos se calculan promediando sobre un corpus de mil prompts. Con eso a la vista, los autores la proponen como instrumento para auditar el alineamiento.</p>

<h2 id="segunda-lectura-desde-américa-latina">Segunda lectura: desde América Latina</h2>

<p>Lo primero que hay que decir es qué NO dice el trabajo, porque es donde se va a torcer al traducirse. Los autores aclaran de forma explícita que toman el acceso consciente como una noción puramente funcional y que no toman posición sobre la experiencia subjetiva. El paper no afirma que los modelos sean conscientes. Afirma que hay una organización interna con propiedades funcionales parecidas. La distinción importa especialmente en la región, donde buena parte de la cobertura de IA llega traducida de titulares en inglés y donde una nota que diga “los modelos son conscientes” tiene consecuencias regulatorias reales sobre debates que ya están abiertos.</p>

<p>Lo segundo es una buena noticia con una trampa. La herramienta es liviana de operar: no exige reentrenar el modelo y produce salidas legibles, con un cálculo previo de los jacobianos que se hace una sola vez. Es exactamente el perfil de instrumento de auditoría que un regulador, una universidad o un equipo de un ministerio de la región podría operar sin comprar capacidad de cómputo de frontera. Pero para aplicarla hay que tener acceso a los estados internos del modelo, y eso solo lo tiene quien posee los pesos o quien es el laboratorio. Un Estado que consume modelos cerrados por API no puede usar esto, ni contratar a alguien para que lo use. Se conecta directo con la historia de los pesos abiertos que venimos siguiendo: aparece una técnica de auditoría concreta y el cuello de botella vuelve a ser el mismo, quién tiene acceso a las tripas. Esta lectura es mía, no del paper, que no discute política de acceso.</p>

<p>Tercero, sobre qué habilita. Si las deliberaciones estratégicas de un modelo quedan legibles antes de que salgan en la respuesta, cambia lo que significa auditar un sistema de IA en el sector público. Hoy las auditorías que se discuten en la región miran entradas y salidas. Esto sugiere que hay una capa intermedia observable. Conviene ser prudente: son resultados de un laboratorio sobre sus propios modelos, y falta ver si sobreviven a réplicas independientes antes de escribirlos en una norma.</p>

<h2 id="la-letra-chica">La letra chica</h2>

<ul>
  <li>Es evidencia interna, no auditoría independiente. Anthropic estudia sus propios modelos y publica en su propio canal, sin revisión por pares externa. Eso no la invalida, pero cambia el peso que se le da.</li>
  <li>Los autores no afirman nada sobre consciencia subjetiva y lo dicen de forma explícita. Cualquier titular que lo sugiera está agregando algo que el texto no tiene.</li>
  <li>El propio trabajo lista limitaciones importantes y vale tenerlas a la vista: la lente solo nombra conceptos que existen como un token único del vocabulario, así que se le escapan nociones que se escriben con varias palabras; trata el espacio como una bolsa de conceptos sueltos y no ve cómo se relacionan entre sí; las lecturas del primer tercio de capas resultan ruidosas y en general ininterpretables; el límite entre lo que es espacio de trabajo y lo que ya es salida se fija con criterio de los autores y no con una definición de principio; y no hay forma de predecir de antemano qué tareas van a usar el espacio y cuáles no. Ellos mismos describen la lente como un instrumento imperfecto, que capta la estructura del espacio de manera solo aproximada e incompleta.</li>
  <li>Se estudió en modelos grandes de producción. No se sabe cómo escala hacia modelos más chicos, que son los que la región tiene más a mano.</li>
</ul>]]></content><author><name>Doble Click</name></author><category term="seguridad" /><category term="ética" /><summary type="html"><![CDATA[Una técnica nueva de interpretabilidad muestra que los modelos mantienen un conjunto reducido de conceptos disponibles para reportar y razonar, encima de un volumen mucho mayor de procesamiento automático. En pruebas de alineamiento, ahí aparecieron deliberaciones que la respuesta final no mostraba.]]></summary></entry></feed>