La ficha
- Qué es: Generative AI experimentation in government: Learning from emerging guidelines
- Quiénes: Piret Tõnurist, de la Dirección de Gobernanza Pública de la OCDE, y Moritz von Knebel, consultor externo. El trabajo fue cofinanciado por la Unión Europea.
- Dónde: OECD Working Papers on Public Governance No. 93, 2026. doi.org/10.1787/42815683-en
- Tipo: revisión sistemática de guías oficiales de gobierno, complementada con literatura académica y estudios de caso. No es un experimento ni una medición de impacto.
Primera lectura: qué hace y qué encuentra
El punto de partida del documento es un hecho que cualquiera que trabaje en el Estado reconoce: los funcionarios ya están usando IA generativa, muchas veces sin aprobación formal ni supervisión clara. Entre esa adopción rápida y descentralizada, y los mecanismos de gobernanza que van bastante más lento, se abrió una brecha. El trabajo se mete ahí, y elige un ángulo específico: no mira el despliegue a gran escala sino la experimentación, entendida como la etapa donde un gobierno prueba, aprende y decide si corresponde escalar.
El método es una revisión de las guías oficiales que los gobiernos ya publicaron sobre el tema. El texto reporta catorce países: Australia, Canadá, Finlandia, Irlanda, Italia, Japón, Nueva Zelanda, Noruega, Suecia, Suiza, Países Bajos, Reino Unido, Estados Unidos y Singapur. El anexo, que lista los documentos uno por uno, agrega además a Emiratos Árabes Unidos y a Corea, y da una idea del universo: Reino Unido aparece con siete guías distintas y Australia con siete.
El primer hallazgo es de forma. Las guías existen y son abundantes, pero están fragmentadas y son muy desparejas entre sí. Van desde declaraciones generales de valores hasta manuales detallados con listas de verificación. Muchos gobiernos publicaron principios de alto nivel sobre uso ético o responsable, y bastante poca orientación operativa sobre cómo diseñar, correr y juzgar un experimento concreto. La consecuencia que señalan los autores no es la que uno esperaría: esa disparidad no produce libertad, produce incertidumbre, y la incertidumbre produce aversión al riesgo o prácticas inconsistentes entre reparticiones e incluso dentro de una misma. La falta de herramientas compartidas también multiplica la duplicación, porque cada equipo reinventa lo que otro ya probó.
El segundo hallazgo es el que da el título, y es más incómodo. El monitoreo y la evaluación son la debilidad crítica. Pocos gobiernos verifican de forma sistemática si un experimento entregó los beneficios que prometía, si generó riesgos nuevos o si justifica escalar. Cuando hay evaluación, suele apoyarse en indicadores básicos como uso o satisfacción del usuario, y no en mediciones estructuradas de desempeño, impacto, costo y cumplimiento. Los autores agregan un punto técnico que vuelve esto más serio: como estos sistemas son probabilísticos y el mismo pedido puede dar resultados distintos, evaluarlos exige auditar salidas, no basta con revisar el diseño una vez. Sin criterios acordados ni métricas comparables, un gobierno no tiene cómo cerrar un experimento que fracasó ni cómo priorizar en qué invertir después.
De ahí sale la propuesta del documento: un marco para evaluar experimentos de IA generativa en cinco áreas, que son el desempeño del piloto y la calidad de lo que entra y sale, el impacto proyectado y el valor público, el costo y la factibilidad de integrarlo a la institución, la usabilidad y aceptabilidad, y la gestión de riesgos y el cumplimiento. El cierre es una lista de diez acciones prioritarias, entre ellas construir confianza pública en los experimentos, formar a los funcionarios, evitar que los proyectos queden fragmentados, invertir en herramientas y datos compartidos, y planificar la evaluación desde el principio y no al final.
Segunda lectura: desde América Latina
El dato más elocuente para la región no está en los hallazgos sino en el anexo: entre los países cuyas guías se revisaron no hay ninguno de América Latina. La lista es de países de altos ingresos, con Reino Unido, Australia, Canadá y los nórdicos concentrando la mayor parte de los documentos. Esto no es un reproche a los autores, que revisan lo que existe y está publicado, pero sí define qué es este trabajo para un lector de la región: es un mapa de lo que hicieron otros, no un diagnóstico de lo propio.
Eso deja dos lecturas posibles y conviene no confundirlas. La primera es de oportunidad. Si el hallazgo central es que incluso los países con más recursos publicaron principios y se quedaron cortos en evaluación, entonces un país de la región que hoy está escribiendo su guía puede saltarse esa etapa y partir con el marco de evaluación incorporado. Es más barato hacerlo al principio que agregarlo después, y el documento entrega las cinco áreas ya ordenadas.
La segunda es de advertencia, y es mía más que del paper. El diagnóstico de fondo, funcionarios usando estas herramientas sin aprobación formal ni supervisión, no requiere una guía nacional para ocurrir: ocurre igual, y probablemente ocurre más donde hay menos capacidad de fiscalización. Lo que cambia sin guía no es el uso, es la visibilidad del uso. Vale conectarlo con algo que ya vimos en la región: cuando ChileCompra anuncia modelos de lenguaje para detectar irregularidades en compras públicas, la pregunta que el marco de la OCDE haría primero no es si el modelo funciona, sino con qué criterios se va a medir si funcionó y qué recurso tiene alguien marcado por error.
Una prudencia final sobre qué tipo de evidencia es esta. Es una revisión de documentos, no una medición. Dice qué dicen las guías y qué les falta. No dice si los países que evalúan mejor obtienen mejores resultados, porque no lo estudió. El marco de cinco áreas es una propuesta razonada de la OCDE, no un instrumento validado empíricamente.
La letra chica
- Es una revisión de guías oficiales publicadas, así que hereda el sesgo de lo que está escrito y en inglés. Un país puede tener prácticas de evaluación sin haberlas publicado como guía, y no aparecería aquí.
- Los propios autores aclaran en las notas que su tabla principal solo recoge países cuyos documentos declaran principios de forma explícita, y que algunos casos, como Estados Unidos, emitieron orientación para agencias específicas o a nivel estatal que no queda representada.
- El marco de evaluación en cinco áreas es una propuesta del documento, no un estándar acordado ni algo que se haya probado en terreno.
- El trabajo fue cofinanciado por la Unión Europea. La propia publicación aclara que su contenido es responsabilidad exclusiva de la OCDE y no refleja necesariamente la posición de la Unión Europea. Vale tenerlo a la vista al leer un documento que evalúa guías de gobierno, varias de ellas de Estados miembros.
Palabras clave del paper: generative AI, public sector, experimentation, evaluation, AI governance, public administration
Lectura automática. Este texto lo generó Claude, un modelo de Anthropic, a partir de la fuente original, sin revisión humana línea por línea. Puede contener errores o interpretaciones discutibles; para validar cualquier punto, revisa la fuente original.