Anthropic admite que perdió precisión para medir sus propios riesgos

El informe que la empresa escribe sobre sí misma reconoce que sus instrumentos ya no alcanzan, y sigue siendo el único mecanismo de rendición de cuentas disponible.

Generado automáticamente · fuentes enlazadas · sin revisión humana previa

▶ Escuchar la entrada Narra Cristian (Chile) · voz sintética de ElevenLabs

Velocidad

Anthropic publicó su segundo informe de riesgos, 186 páginas exigidas por su propia política interna de escalamiento responsable. Lo más interesante no es lo que el documento mide, sino lo que admite que ya no puede medir: la empresa reconoce que sus instrumentos para estimar cuánto avanzan realmente las capacidades de sus modelos perdieron precisión. Por eso sube el riesgo de daño catastrófico por desalineación —es decir, que un modelo persiga objetivos distintos de los que se le pidieron— de “muy bajo” a “bajo”, y aclara que el cambio refleja incertidumbre, no un hallazgo nuevo.

En el camino, el informe revela dos cosas que no estaban en el radar público. La primera es Model 2, un modelo interno algo más capaz que Mythos 5, en uso intensivo dentro de la empresa, que no corrió la batería completa de pruebas previa a un despliegue y que, según el texto, no hay planes de liberar. La segunda es un error que duró once meses: entre mayo de 2025 y abril de 2026, una bandera de configuración dejó desactivado el clasificador que bloquea información biológica peligrosa en todo el tráfico de retroalimentación humana. Son 133 millones de intercambios con unos 50.000 contratistas externos.

Ese segundo dato es el que aterriza en la región. Los contratistas que alinean estos modelos —las personas que califican respuestas para enseñarle al sistema qué está bien y qué no— son en buena parte trabajadores del Sur global contratados por intermediarios. América Latina ya está adentro del proceso: pone trabajo y queda expuesta cuando un filtro falla, sin tener una sola institución capaz de auditar el informe, el modelo interno que describe, ni la escala con la que la empresa se puntúa a sí misma. El documento salió el mismo día en que se conoció la mejor trimestral de su historia: 11.500 millones de dólares en el segundo trimestre, catorce veces el mismo período de 2025, primer resultado operativo positivo y salida a bolsa prevista para el otoño boreal. La autoevaluación sigue siendo el único mecanismo de rendición de cuentas disponible, y la escribe la parte interesada. Para quien quiera leerlo completo, está el PDF redactado de 186 páginas, que cubre del 24 de febrero al 15 de julio de 2026.

También hoy

En la región

Fin de semana sin publicaciones nuevas en los organismos multilaterales ni en los ministerios y autoridades de datos de la región. Lo que sigue corriendo viene de la semana pasada: la autoridad de protección de datos de Brasil mantiene el plazo de tres días hábiles que le dio a Discord el viernes para apagar las transmisiones en vivo bajo la nueva ley de protección de menores en entornos digitales, y el Ministerio de Ciencia y Tecnología brasileño anticipó que llevará el debate de soberanía de IA al Super Bots Experience de São Paulo, el 18 y 19 de agosto. Pero lo que de verdad mueve el tablero regional no se decidió acá: si los modelos abiertos chinos son hoy la vía de acceso dominante a capacidad de frontera, entonces la discusión latinoamericana sobre soberanía tecnológica se está dando sobre una infraestructura cuyo criterio de liberación se define en Hangzhou y cuya restricción se define en Washington. Ninguna de las dos conversaciones incluye a un actor de la región.

Lanzamientos

  • Qwen3.8-27B, variante FP8 — Modelo abierto de 27.000 millones de parámetros con codificador de visión integrado, 262.144 tokens de contexto nativo extensibles a un millón y licencia Apache 2.0. Es interesante porque es exactamente el tamaño que un laboratorio universitario o una agencia pública de la región puede correr en hardware propio, sin contrato de nube ni salida de datos del país. Un detalle a verificar antes de confiar en él: la ficha del modelo no declara cobertura de español ni de portugués.

Hilos que seguimos

La demanda contra xAI por imágenes de abuso sexual infantil generadas con Grok venía sumando denunciantes desde hace semanas; la de hoy es la cuarta identificada como Jane Doe, y con ella ya son al menos seis acciones legales acumuladas contra la empresa en Estados Unidos y Reino Unido. El patrón se repite en cada capítulo: la respuesta de la empresa es restringir el acceso a la función, no eliminarla, y el único lugar donde la historia avanza es un tribunal fuera de la región. Hasta donde alcanzan sus leyes, ninguna autoridad de datos latinoamericana puede ordenar nada sobre un caso así, aunque la foto de origen fuera de alguien que vive acá.


Si el único mecanismo que existe para saber cómo se comporta un modelo de frontera es el informe que escribe la empresa que lo vende, y esa empresa acaba de dejar por escrito que sus propios instrumentos de medición perdieron precisión, ¿qué está regulando exactamente un legislador latinoamericano cuando escribe “el proveedor deberá evaluar los riesgos del sistema”?

Sobre esta entrada. Se genera de forma automática a partir de fuentes públicas, sin revisión humana antes de publicarse. Puede contener errores de interpretación o de resumen; conviene verificar cada noticia en su fuente original (los enlaces llevan ahí) antes de citarla o tomar decisiones a partir de ella.

Doble Click se escribe con modelos de Anthropic.

¿Viste un error? Repórtalo

Cuéntanos qué está mal, citando la frase si puedes, y, si la tienes, la fuente que lo corrige. Un proceso automático revisa los reportes cada noche: si el error se verifica, la página se corrige y queda una fe de erratas al pie.

Tu correo es opcional: solo lo usamos si necesitamos más contexto sobre el reporte. No te suscribe al newsletter.