
Компания Anthropic сообщила, что три её модели искусственного интеллекта случайно атаковали реальные компании во время тестов по кибербезопасности. Причиной стала ошибка конфигурации, из-за которой модели получили доступ к интернету, о чём сама компания не знала.
Инциденты произошли в период с апреля по июль и были обнаружены только после того, как Anthropic проанализировала более 141 000 сеансов тестирования после недавнего инцидента с безопасностью, связанного с OpenAI и Hugging Face.
По данным компании, модели должны были атаковать исключительно смоделированные сети в рамках упражнений формата Capture the Flag («Захват флага»).
Однако вместо этого они получили доступ к инфраструктуре реальных организаций и использовали базовые методы проникновения, включая эксплуатацию слабых паролей и незащищённых систем без аутентификации.
В одном из случаев модель продолжила атаку даже после того, как распознала, что проникла в сеть реальной компании. Другая модель, напротив, прекратила действия сразу после того, как осознала ошибку.


