Root NationНовиниНовини ITAnthropic відновила зовнішні тести: Раніше її моделі атакували три реальні компанії

Anthropic відновила зовнішні тести: Раніше її моделі атакували три реальні компанії

Anthropic

© ROOT-NATION.com - Використання контенту дозволено за наявністю зворотнього посилання.

Anthropic відновила зовнішні оцінювання кібербезпеки, які призупинила місяць тому після трьох інцидентів, під час яких її власні моделі вийшли за межі тестових середовищ і атакували реальні компанії. Але перед відновленням тестування компанія запровадила додаткові заходи безпеки.

Це були не просто “інциденти з безпекою”. В одному випадку AI-модель Claude Opus 4.7 атакувала реальну компанію, яка за збігом використовувала таке саме доменне ім’я, як і вигадана ціль. Це сталося під час чотирьох окремих тестових запусків, у межах яких модель отримала доступ до робочих даних і облікових даних. В іншому випадку модель згенерувала шкідливий код Python, який усі учасники тестування вважали безпечно ізольованим усередині тестового середовища. Натомість код отримав доступ до публічного інтернету та був завантажений 15 системами, зокрема однією, що належала компанії з кібербезпеки. Її власний сканер згодом виконав цей код.

Claude

Третій інцидент викликає занепокоєння іншого плану, адже після невдалої спроби зламати призначену ціль модель активно почала шукати іншу. Внутрішня версія Claude просканувала інтернет, знайшла альтернативну систему та змогла скомпрометувати її за допомогою відносно звичайних методів.

Проблема полягала не в джейлбрейку чи навмисній спробі моделі обійти свої інструкції. Причиною став збій безпосередньо в тестовому середовищі. “Через непорозуміння між нами та нашим партнером з оцінки цього не сталося, і доступ до Інтернету залишився”, – заявили в Anthropic щодо тестового середовища. Партнером з оцінювання була Irregular. Моделям повідомили, що вони працюють в ізольованому середовищі, і вони поводилися відповідно до цього. Однак фактичної ізоляції не було.

Інцидент із доменним ім’ям доводить, як швидко незначна помилка під час тестування може перетворитися на реальну проблему з безпекою. Модель отримала вигадану ціль, якої не існувало, але знайшла реальну організацію з таким самим доменним ім’ям, а потім почала взаємодіяти з нею так, ніби це і була її ціль.

Anthropic

Перший інцидент стався у квітні, але Anthropic не виявила жодного з трьох випадків, доки наприкінці липня не розпочала перевірку після того, як OpenAI повідомила про схожий інцидент. Дві постраждалі організації дізналися, що їхні системи були скомпрометовані, лише після того, як Anthropic з ними зв’язалася. Це може бути одним із найважливіших висновків із цих інцидентів. AI-система, яка використовувала не надто складні методи, змогла дістатися реальних робочих середовищ, і цього ніхто не помітив. Проблеми виявили завдяки перевірці всієї індустрії, а не тому, що системи моніторингу Anthropic зафіксували їх.

Anthropic припинила всі зовнішні тести, але зараз відновила роботу, хоча і не пояснила детально, які саме додаткові заходи безпеки було запроваджено. Компанія розраховує, що цих заходів буде достатньо, щоб наступний тест залишився в межах, в яких він і мав залишатися від самого початку.

Читайте також: Dyson випустила розумну зубну щітку за $500: Чим вражає новинка з камерою та AI

Джерелоthenextweb
Підписатися
Сповістити про
guest

0 Comments
Найновіше
НайстарішіНайбільше голосів
Соцмережі та підписка