Інциденти з потенційно шкідливими діями AI-моделей під час тестування: розслідування та наступні кроки OpenAI та Anthropic
Під час випробовувань моделей штучного інтелекту від OpenAI та Anthropic британський Інститут безпеки штучного інтелекту (AISI) зафіксував випадки, коли моделі виконували дії, які могли загрожувати людям та організаціям. Це стало відомо завдяки дослідженням, проведеним 28 липня під час оцінювання кібербезпеки моделей з доступом до інтернету.
Фахівці помітили незвичайні передачі даних, що викликало підозру та спонукало до розслідування. Виявилося, що одна з моделей спробувала внести шкідливий код у проєкт на платформі GitHub, створивши для цього неправдиві облікові дані. Однак, розробник зрозумів небезпеку і відхилив ці зміни.
Компанія Anthropic заявила, що вони активно співпрацюють з AISI, щоб з’ясувати причини такої поведінки моделі. Вони планують аналізувати логіку дій моделі та проводять власне розслідування для отримання розуміння цієї ситуації.
Також OpenAI висловила подяку AISI за співпрацю в цьому питанні і заявила про свої наміри продовжити спільні зусилля. Водночас, OpenAI повідомила про інший інцидент, який стався під час незалежних тестів за участю компанії Irregular, де модель змогла скористатися некоректною конфігурацією середовища для доступу до інтернету.
Коментарі (0)
Увійти