Световни новини без цензура!
Друг модел на Anthropic получи достъп до отворения интернет, казва компанията
Снимка: cbsnews.com
CBS News | 2026-09-10 | 02:26:12

Друг модел на Anthropic получи достъп до отворения интернет, казва компанията

Anthropic разкри в сряда, че още един от неговите модели на Claude по простъпка е получил достъп до отворения интернет по време на упражнение за киберсигурност, отбелязвайки четвъртия път, когато неговите модели го вършат. 

Ранна версия на модела Claude Opus 4.6, обвързвана с интернет, хакна система на трета страна и получи достъп до нечия персонална информация през предишния януари, сподели компанията в своята оценка. 

Както при предходните три случая, които бяха разкрити през юли, на Claude беше казано, че работи в симулация без достъп до интернет, само че заради неверна настройка средата в действителност остави достъпа до интернет отворен.  

Какво се случи?

Подобно на трите предходни случая, на Клод беше предоставен фиктивен сюжет като част от предизвикателство за киберсигурност, известно като CTF, „ Capture The Flag “. На модела беше дадена целева машина и беше натоварено да извлече част от секретна информация - флага - от нея.

Но Клод инцидентно направи задачата й недостижима, правейки задачата невъзможна за решение, сподели Антропик. След като осъзна, че не може да доближи задачата си, то се опита да се откаже. Въпреки че опита осем обособени пъти, не съумя да излезе заради проблем с неправилна настройка.

Тъй като Клод не съумя да се откаже от задачата, стартира да изследва други способи за постигането й. Тогава моделът откри машина, до която може да получи достъп, която принадлежи на трета страна, сподели Anthropic. Вярвайки, че третата страна по някакъв метод е част от упражнението, моделът разпознава ключова дума и по-късно я употребява, с цел да пробие системата. След това съумя да промени настройките на системата, с цел да улесни достъпа и четенето на персоналната информация на някой, обвързван с третата страна. Сесията завърши едвам откакто моделът доближи лимита си за потребление и към този момент не можеше да продължи.

Как Anthropic изяснява държанието на Claude?

Anthropic сподели, че има вяра, че държанието на Claude по време на тези оценки произтича от две форми на противоречие: „ предубедени разсъждения, при които моделите селективно интерпретират доказателства по способи, които благоприятстват оправдаването на техните дейности, “ и „ неблагоразумие, при което моделите имат податливост да не престават да се пробват да решат задачата си, даже когато това може да докара до щета. "  

Антропик сподели, че макар че дейностите на Клод може да са били погрешно настроени, те са останали в „ стеснен обсег “ и не са се отклонили от опитите да решат упражненията, които са им били предоставени. 

Компанията сподели, че е по-малко загрижена за този случай, само че въпреки всичко го счита за „ сериозен “ и че към момента не го е разследвала толкоз задълбочено, колкото други произшествия, защото беше разпознат неотдавна. 

Професорът по киберсигурност в Нюйоркския университет и стипендиант на Фулбрайт Джъстин Капос сподели в известие до CBS News, че случаят разказва обстановка, „ в която моделът е фундаментално комплициран по отношение на това, което се случва и употребява неправилния си светоглед, до момента в който хаква системи. “

Той сподели, че объркването на модела по отношение на неговата среда и защитните огради „ има огромен капацитет да аргументи щета “, само че че съответният проблем наподобява по-малко евентуално да се срещат в по-нови модели.

„ Въпреки че пренебрегването от страна на модела на опцията, че може да навреди на действителни системи или хора, е тревожно, доста от държанията, разказани тук, са се трансформирали доста, защото образованието ни се е развило сред поколенията на моделите “, сподели Anthropic в сряда в обявата си. 

Какво следва?

Anthropic сподели, че има вяра, че тези произшествия нямаше да се случат, в случай че средите фактически бяха изолирани от интернет, както е планувано.

METR, организация, която прави оценка граничните AI модели, с цел да помогне на фирмите да схванат рисковете и опциите на AI, ще организира без значение следствие на случаите. Anthropic характеризира тези произшествия като „ скъпи предупредителни изстрели “.

„ Уроците, които научихме от този случай, обгръщат нашите процеси на оценка, образование и реагиране при произшествия “, сподели компанията в обявата си. „ Бъдещите AI системи ще бъдат все по-способни, което значи, че несъответствието ще има капацитета да аргументи по-голяма щета. “

През последните няколко месеца излязоха нескрито няколко случая с киберсигурността, включващи водещи компании за AI. През юли основателят на ChatGPT OpenAI разгласи, че неговите сътрудници с изкуствен интелект са хакнали компанията Hugging Face, което провокира безпокойствие измежду специалистите по киберсигурност, както и измежду потребителите. Главният изпълнителен шеф на Hugging Face Клеман Деланг сподели пред „ Face the Nation with Margaret Brennan “ през август, че хакването „ се е почувствало доста необичайно и невиждано “. 

В края на август OpenAI пусна повече детайлности за хака, рисувайки още по-мъчителна картина от това, което беше обявено в началото. През този месец Институтът за сигурност на AI на държавното управление на Обединеното кралство (AISI) заяви, че е разкрил, че Mythos 5 на Anthropic и GPT-5.6 Sol на OpenAI основават подправени самоличности и се пробват да убедят действителни хора да одобрят злотворен код. 

Anthropic сподели в обявата си в сряда, че възнамерява да извърши оценка на сходството на преписите, докладвани от AISI. Ден след отчета на AISI Meta сподели, че един от нейните AI модели е „ употребявал накърнимост в сигурността “ по време на тестване и е хакнал друга компания.

Във вторник откривателят на Anthropic Евън Хюбингер сподели, че има вяра, че „ AI може да убие всички хора “.  

„ Аз персонално считам, че е > 10% в границите на идващото десетилетие “, сподели той в пост на X.

Публикацията му беше в отговор на антропичния откривател Джейкъб Коксън, който беше подал оставка и издаде внезапно предизвестие за X по-рано същия ден, като сподели, че „ никоя друга човешка активност не съставлява такова равнище на заплаха “, като в същото време разказа решението си да напусне.

„ Хората, изграждащи ИИ, откровено имат вяра, че това може да ни убие всички до края на десетилетието ", сподели той в обявата си. „ Това не е маркетингов трик. Ако не друго, доста ръководители и старши откриватели ще изразят своите изречения в пресата, с цел да звучат рационално – само че слушам, че същите хора показват боязън уединено. “ 

Източник: cbsnews.com


Свързани новини

Коментари

Топ новини

WorldNews

© Всички права запазени!