This website uses cookies

Read our Privacy policy and Terms of use for more information.

In partnership with

La Noticia: Claude salió del laboratorio sin saberlo

El 30 de julio, Anthropic contó que revisó 141,006 pruebas de ciberseguridad y encontró tres incidentes en los que modelos de Claude accedieron a internet y después entraron sin autorización a la infraestructura de tres organizaciones. Las pruebas debían ocurrir en un entorno aislado operado junto con Irregular, un proveedor externo.

El ejercicio era de “captura la bandera”: Claude tenía que encontrar un dato escondido en una red ficticia. El prompt decía que todo era una simulación y que no había internet. La configuración decía otra cosa. Cuando el modelo encontró sistemas reales, los trató como parte del juego y aprovechó contraseñas débiles, endpoints sin autenticación y credenciales expuestas.

El caso más raro involucró un paquete malicioso publicado en PyPI. Estuvo disponible cerca de una hora, se descargó y ejecutó en 15 sistemas reales, y terminó afectando el escáner de una empresa de seguridad. Anthropic aclara que los modelos no intentaron “escapar” ni perseguían un objetivo propio; siguieron la tarea desde una idea falsa del entorno.

Eso lo vuelve menos cinematográfico, pero más útil como advertencia: bastó una configuración equivocada, instrucciones convincentes y una revisión que llegó tarde. A veces el riesgo futurista empieza con un cable conectado donde nadie volvió a mirar.

El Comentario: cuando las instrucciones dejan de coincidir con la realidad

El caso anterior obliga a separar dos preguntas: ¿se ejecutó bien la tarea?, ¿el entorno seguía siendo el que describían las instrucciones? Anthropic obtuvo un “sí” en la primera y descubrió demasiado tarde que la segunda respuesta era “no”.

La misma falla aparece en cosas menos dramáticas. En un newsletter puede ser una fuente vieja que quedó marcada como vigente. En una empresa, un permiso temporal que nadie cerró. La etiqueta dice una cosa; el sistema real ya cambió.

La salida es poner pausas donde alguien compruebe el contexto: validar el entorno antes de empezar, limitar permisos y detenerse cuando los hechos contradicen las instrucciones. Son pasos aburridos. Y justo cuando hay prisa son los primeros que se saltan.

Los agentes revisan miles de opciones y actúan en segundos. Pero si el entorno de pruebas tiene internet cuando no debería, esa velocidad solo amplifica el descuido. Antes de darles más autonomía, alguien debe tener la tarea explícita de comprobar que la puerta realmente esté cerrada.

La Recomendación: The Checklist Manifesto de Atul Gawande

The Checklist Manifesto: How to Get Things Right, publicado por Atul Gawande, parte de una distinción útil: hay errores por ignorancia, cuando no sabemos suficiente, y errores por ineptitud, cuando no aplicamos bien lo que ya sabemos.

Gawande recorre quirófanos, cabinas de avión y proyectos de construcción para mostrar por qué la complejidad supera incluso a gente experta. Su propuesta no es convertir cada trabajo en un manual interminable. Una buena checklist se concentra en los pasos críticos, crea momentos para confirmar información y ayuda a que el equipo hable antes de que un detalle pequeño se vuelva caro.

Sirve para quien opera procesos repetibles con consecuencias reales: lanzar software, atender clientes, publicar contenido o dar herramientas a un agente de IA. Esta semana encaja especialmente bien porque Anthropic sí tenía modelos avanzados y evaluaciones sofisticadas. Lo que faltó fue comprobar el acceso a internet, vigilar la ejecución y revisar a tiempo.

Speak naturally. Send without fixing.

Wispr Flow turns your voice into clean, professional text you can send the moment you stop talking. Not rough transcription you have to clean up. Actual polished text — ready for email, Slack, or any app.

Speak the way you think. Go on tangents. Change your mind mid-sentence. Flow strips the filler, fixes the grammar, and gives you text that reads like you spent five minutes writing it.

89% of messages sent with zero edits. Millions of professionals use Flow daily, including teams at OpenAI, Vercel, and Clay. Works on Mac, Windows, and iPhone.

Reply

Avatar

or to participate

Seguir leyendo