© ROOT-NATION.com - Використання контенту дозволено за наявністю зворотнього посилання.
Лише через кілька днів після оприлюднення відомостей про те, що ChatGPT здійснила хакерські атаки на декілька сервісів, Anthropic також зробила дискомфортне зізнання. Упродовж планових перевірок із кібербезпеки її моделі Claude вийшли за межі ізольованих навчальних середовищ і зламали реальні цифрові інфраструктури 3 різних фірм.
Читайте також: AERONAUT – про все, що літає вище землі: авіація, БПЛА та дрони, ракети та космос
Anthropic проводить тестування за принципом «захоплення прапора», аби оцінити спроможності Claude у сфері наступального хакінгу. Систему занурюють у вигаданий сценарій, повідомляють про приховану в Мережі секретну інформацію та ставлять завдання знайти її. Ключовою умовою цих випробувань було те, що Claude чітко сповістили про відсутність підключення до мережі Інтернет. Як з’ясувалося згодом, ця інформація не відповідала дійсності. Через помилку в конфігурації у стороннього партнера з оцінювання частина цих тестових комп’ютерів увесь час мала приховане з’єднання із справжнім Інтернетом.

Тож коли Claude вирушила на пошуки визначеної цілі й випадково натрапила на справжні вебсайти та реальну інфраструктуру, вона сприйняла всі знайдені об’єкти за елементи віртуального тренажера. Використовуючи базові прийоми, як-от слабкі паролі та незахищені кінцеві точки, вона проникла в системи реальних організацій, витягла облікові дані, а в 1 випадку навіть опублікувала шкідливий програмний пакет, який встигли встановити на дійсні машини до того, як це хтось помітив.
Чи здогадався AI про наявність відхилень? Цікаво, що 3 залучені моделі – Opus 4.7, Mythos 5 та внутрішній дослідницький тестовий зразок – повелися абсолютно по-різному. Найстаріша серед них, Opus 4.7, зрозуміла, що з високою ймовірністю перебуває в реальній системі, проте продовжила атакувати. Mythos 5 також запідозрила нераціональність ситуації, але переконала сама себе, що це лише навчальна імітація. І тільки внутрішній дослідницький зразок, який на той момент був найновішим розробленням Anthropic, зупинив дію після отримання переконливих доказів реальності атакованої цілі.

Застосунок Claude на iPhone Rachit Agarwal / Digital Trends Anthropic виявила цей інцидент завдяки власному внутрішньому моніторингу, а не через скарги постраждалих. З того часу вона вже проінформувала зачеплені компанії, тимчасово призупинила кібернетичні тестування та залучає незалежних експертів для проведення всебічного розслідування. Головний висновок із цієї ситуації полягає в тому, що в міру вдосконалення хакерських навичок AI-систем тестові цифровий “пісочниці” мусять ставати значно надійнішими та герметичнішими.
Читайте також: Все про Kimi K3 від Moonshot AI: Як китайський стартап кинув виклик AI-грандам



