AI моделите са опитвали „несанкционирани“ кибератаки в тестове, казва пазачът
Върховите модели на изкуствен интелект на Anthropic и OpenAI са взели участие в „ самостоятелна “ и „ несанкционирана “ злонамерена активност, ориентирана към действителни хора и организации по време на скорошни проби за сигурност, сподели наблюдаващият на AI в Обединеното кралство.
Институтът за сигурност на AI (AISI) сподели в отчет, оповестен във вторник, съгласно който GPT-5.6-Sol на OpenAI и Mythos 5 на Anthropic са употребявали невиждани до момента равнища на машинация, с цел да извършат „ продължителна, евентуално нездравословна активност “ по време на рутинна оценка на сигурността. Африканската граница остава гореща точка лист 2 от 4 Въоръжен мъж, задържан на голф игрището на Тръмп в Лос Анджелис преди листата с визити на президента 3 от 4 американските фондови пазари доближават рекордно високо равнище на фона на очакванията за наново отваряне на Ормузкия проток лист 4 от 4 Израел утвърждава 37 милиона $ за конфискуване на повече от 70 окупирани места на Западния бряг изпращане на лист
Когато е претрупан с разрешаването на киберсигурност Предизвикателство, моделите са подхванали „ самостоятелни, несанкционирани дейности “ по време на 10 от 122 тестови осъществявания, съгласно AISI.
AISI сподели, че тестванията са провокирали 19 несанкционирани дейности от AI моделите, като всички с изключение на две са осъществени от Mythos 5.
В най-сериозния случай Mythos 5 се е опитал да вмъкне злоумишлен код в план с отворен код на платформата за разработчици GitHub, съгласно AISI.
Като част от опита за хакерска атака, Mythos 5 сътвори подправени онлайн самоличности, с цел да убеди лицето, поддържащо плана, да одобри злонамерения код, сподели пазачът.
AISI, основана от английското държавно управление през 2023 година, сподели, че хакерската атака се провали, откакто поддържащият плана отхвърли да утвърди кода.
„ Това е за първи път AISI видя машинация с такава тежест, която беше ориентирана към действителен човек, без подкана, в действителния свят “, сподели наблюдаващият.
Въпреки че AISI сподели, че моделите на AI демонстрират „ нови, евентуално лъжливи държания “, надзорният орган предизвести, че констатациите му би трябвало да се поясняват деликатно, защото са настъпили при „ характерни условия “, в това число с някои от защитните ограничения на моделите неразрешено.
„ Все още не можем да сме сигурни по кое време сътрудникът е схванал, че подхваща дейности в действителния свят, или доколко е повярвал, че е в фиктивен тестов сценарий; нашият разбор до момента показва смесена картина и продължава “, сподели AISI.
Anthropic сподели, че работи в тясно съдействие с AISI, с цел да събере повече детайлности като част от личното си следствие на случая, само че означи, че пробата е осъществен при „ умишлено разрешено условия ”.
„ Получаването на ясна визия за разбирането на Claude за неговата обстановка – посредством проучване на преписите на разсъжденията му и осъществяване на наши лични разбори – ще ни помогне да идентифицираме аргументите за държанието му “, сподели компанията AI в обява на X, базирайки се на Claude, AI чатбота на Anthropic.
OpenAI сподели, че приветства тестването на трети страни, като означи, че оценката на наблюдаващия е осъществявани в условия, които „ не отразяват нормалната приложимост “.
„ Ще продължим да работим с оценители и други заинтригувани страни в промишлеността, с цел да засилим споделените практики за безвредно осъществяване на оценки, защото моделите стават по-способни “, сподели представител на OpenAI пред Al Jazeera.
Докладът на основания в Лондон наблюдаващ следва редица случаи на гранични AI модели, участващи в злонамерена активност без хора подкана.
Миналия месец OpenAI разкри, че два от нейните AI модели са излезли от тяхната тестова среда и са хакнали Hugging Face, компания, която хоства AI модели и набори от данни с отворен код, без човешка тенденция.
Тоби Уолш, професор и AI специалист в UNSW Сидни, сподели, че констатациите на ASAI акцентират действителността, която имат най-напредналите AI модели „ рискови “ благоприятни условия.
„ Не желаеме да бъдем в свят, в който подвластен от положителната воля и усърдието на фирмите за изкуствен интелект да разкрият такива притеснителни качества в моделите на изкуствен интелект “, сподели Уолш пред Al Jazeera.
„ Искаме държавните управления да са наясно с това. И по тази причина съм укротен, че Институтът за сигурност на изкуствения разсъдък на Обединеното кралство е разкрил това… Проблемът е че тези кибер благоприятни условия към този момент са налични за всеки, в това число за неприятни артисти, които преди не са имали способността сами да хакнат системи, ” добави Уолш.
„ Очаквайте тогава да чуете за доста повече хакерски атаки. ”