Штучний інтелект уже намагаються використовувати не лише для звичайної роботи, а й у небезпечних біологічних та кіберпроєктах. Anthropic повідомила про реальні випадки, коли Claude залучали до запитів, пов’язаних із посиленням властивостей вірусів, створенням токсинів і хакерськими завданнями.
У компанії пояснили, що найскладніше в таких випадках — відрізнити легітимне наукове дослідження від роботи, яка може становити загрозу. Методи, які застосовують для розробки вакцин або вивчення патогенів, іноді майже не відрізняються від підходів, що можуть використовуватися для посилення небезпечних властивостей вірусів.
Саме тому Anthropic вирішила блокувати підозрілі сценарії ще до того, як стане зрозумілим кінцевий намір користувача. У компанії вважають, що потенційні наслідки помилки в таких випадках занадто серйозні.
Серед виявлених випадків був запит, пов’язаний із вірусом Чикунгунья. Система безпеки перехопила спробу підготувати грантову заявку для дослідження, яке передбачало посилення заразності вірусу та його здатності обходити імунний захист.
Anthropic також зафіксувала схожі запити щодо пташиного грипу. Йшлося про експерименти, спрямовані на штучну зміну властивостей патогена, що викликало додаткові побоювання у фахівців компанії.
Ще один випадок стосувався токсинів. Один із дослідників використовував Claude для побудови генеративної системи, яка мала оптимізувати характеристики пептидних отрут і підвищувати їхню ефективність.
Окремо компанія повідомила про спроби використовувати Claude для кібероперацій і створення пропагандистських матеріалів. Частину таких запитів вдалося виявити та заблокувати завдяки системам внутрішнього контролю.
Керівник відділу аналізу загроз Anthropic Джейкоб Клейн наголосив, що небезпечні наміри рідко формулюють прямо. Саме тому оцінювати доводиться не окрему фразу користувача, а весь контекст його роботи з моделлю.
Старший науковий співробітник Ради зі стратегічних ризиків Ендрю Вебер назвав описані випадки тривожними прикладами того, як передові можливості ШІ можуть намагатися використати в біологічних програмах, зокрема пов’язаних із державними структурами.
Anthropic заблокувала акаунти, які були пов’язані з виявленими зловживаннями. При цьому компанія не стала розкривати імена дослідників або назви лабораторій, оскільки не мала прямих доказів злочинного наміру.
Зібрані дані Anthropic використала для посилення захисту Claude та вдосконалення систем, які мають раніше виявляти потенційно небезпечні сценарії використання ШІ.
🌟 Читайте «Експерт» у своєму смартфоні — додайте нас в Google Discover
