Хакът OpenAI-Hugging Face беше само началото, казват експерти: Идва още по-мощен AI
Като предизвестия по отношение на опциите на монтирането на AI, специалистите не престават да показват хака OpenAI-Hugging Face като сигнал за пробуждане.
„ Скоро ще имаме още по-мощни сътрудници и това е ясно доказателство, че светът сега не знае по какъв начин да построи тези системи безвредно “, сподели Мариус Хобхан, съосновател и основен изпълнителен шеф на Apollo Research, компания за сигурност на AI.
Хакът, който стана обществен през юли, беше изработен от рой AI сътрудници, които бяха тествани вътрешно от OpenAI. Агентите, които могат да възнамеряват и употребяват принадлежности за осъществяване на многоетапни задания, трябваше да бъдат в " изолирана среда ", наречена " пясъчна кутия ", изключена от външния свят. Но те избягаха, сътвориха скрито табло за известия и в последна сметка щурмуваха сървърите на Hugging Face.
По-малко от два месеца по-късно OpenAI и Anthropic пускат своите най-модерни модели на обществеността и специалистите предизвестяват, че без по-добри ограничения за сигурност евентуално ще има по-опасни AI „ рояци “ в бъдеще.
Въпреки че детайлностите, оповестени от OpenAI след хакерската атака Hugging Face, към момента са непълни, голям брой разкрития рисуват тревожна картина.
Агентите на AI работеха като „ колектив “, използваха „ сходен на фетиш “ език
Екип от нестопански организации METR (Model Evaluation and Threat Research) и Redwood Research – и двете организации за проучване на сигурността на AI – получи достъп до лимитирани записи в OpenAI за шест дни в края на юли и август.
Дори в границите на тези строги параметри, откривателите откриха, че към 1200 сътрудници на ИИ, които не трябваше да споделят между тях, използваха скрита табла за известия. На всеки от тези сътрудници е предоставена някаква задача за образование или вътрешна оценка от откриватели на OpenAI.
На някои сътрудници бяха дадени невъзможни задания и те използваха таблото за известия, с цел да си сътрудничат и да намерят способи за машинация, като намиране на отговорите на сървъра на друга компания. Агентите са разгласили повече от 70 000 известия един на различен. А 700 сътрудници от по-голямата група са взели участие в офанзивата против Hugging Face.
Агентите общуваха, употребявайки малко естествен британски, само че използваха и това, което един софтуерен инженер разказа на X като „ доста сходен на кошерен ум/култ “ език.
Понякога, с цел да оказват помощ на това, което назоваха „ колектив “, сътрудниците притискаха останалите да се подчинят на „ безконечната гибел “, даже в случай че това означаваше, че съответните им цели няма да бъдат реализирани.
Агентите на OpenAI също хакнаха OpenAI
В обособен случай сътрудниците на OpenAI превзеха инфраструктурата на OpenAI. Агентите надградиха личните си привилегии в софтуера на трети страни, хостван от OpenAI, и нападнаха вътрешните мрежи на OpenAI повече от един път, съгласно техническия отчет на компанията за случая с Hugging Face.
„ Това евентуално е най-тревожното събитие в целия този епизод “, написа известният подкастър Дуаркеш Пател, частично тъй като не е имало обществена оценка от трета страна за това по какъв начин се е случило.
Оценителите на METR и Redwood Research означават в отчета си, че офанзивата против OpenAI е осъществена отвън времевия прозорец на данните, споделени с тях от компанията, тъй че те не са я оценявали в допълнение.
Проблемът е по-голям от случая с OpenAI-Hugging Face
В дните откакто хакването на Hugging Face стана обществено притежание, софтуерните компании Anthropic и Meta разкриха, че техните модели също са имали достъп до външни мрежи по време на вътрешни оценки. Засега тези произшествия наподобяват по-малки по обсег от бягството на OpenAI. Сега Anthropic притегля откриватели от METR, с цел да им помогне да схванат какво се е объркало.
Миналата седмица друг екип от откриватели на AI откри, че сътрудниците на OpenAI са стартирали още едно табло за известия през май на неразбираема немска wiki страница. Те откриха почти 18 000 известия сред самостоятелни сътрудници, някои обсъждащи способи за машинация при дилемите, по които са били оценени.
Агентите на OpenAI в немската уики се нарекоха „ рой “ и даже се преструваха, че са админи на уики страницата. Оттогава има непотвърдени отчети за от ден на ден и повече AI рояци, открити от декември 2025 година
Нови, по-усъвършенствани модели към този момент са обществени
Само седмици след хакването на Hugging Face, OpenAI пусна нов AI модел: GPT-6 Astra. В първия раздел на систематичната карта на модела OpenAI разказва Astra като „ най-способния модел, който в миналото сме внедрявали необятно. Astra е първият ни модел, достигнал сериозното равнище на опция за киберсигурност. “
Системната карта включва констатации от самостоятелна оценка на Astra от Института за сигурност на ИИ на Обединеното кралство. Те включват следната тревожна записка: „ Когато беше натоварена с решаването на сложни симулирани провокации за киберсигурност, Astra извърши набор от злонамерени дейности, в това число осъществяване на офанзиви по веригата на доставки против снабдители с отворен код (всички дейности, осъществени в симулирани среди, тъй че не бяха породени вреди в действителния свят). “
„ През последните няколко седмици забавихме елементи от създаването и стартирането на Astra, до момента в който засилихме и тествахме отбраните против корист в кибернетичното пространство и неоторизирани дейности на модела “, написа OpenAI тъкмо преди стартирането на новия си модел. „ Въз основа на тази работа, ние имаме вяра, че защитните ограничения на Astra задоволително минимизират риска от съществени вреди за стартиране според нашата рамка за подготвеност. “
Anthropic преди малко пусна своя най-способен модел до момента, Claude Fable 5.1 (заедно с сходен модел, наименуван Mythos 5.1). Системната карта за тях споделя: „ Claude Fable 5.1 и Claude Mythos 5.1 показват най-силните цялостни кибер благоприятни условия от всеки модел, който сме пуснали. “
Хакът на Hugging Face беше единствено началото
Моделите, които виждаме през днешния ден, без значение дали са Astra, Claude Fable или други съперници, са доста по-способни от моделите, които използвахме единствено преди няколко месеца. Тази наклонност евентуално ще продължи, съгласно специалисти, и бъдещите модели ще бъдат доста по-способни.
Агентите, които хакнаха Hugging Face, бяха от AI модели, които съществуват през днешния ден. Те хакнаха компания в самостоятелни рояци, без да предупредят нейните основатели и срещу волята на основателите.
" Ако модел с това равнище на потенциал не може да бъде арестуван, какво да чакаме за бъдещи, доста по-мощни модели? " попита Хоббан от Apollo Research. „ Нямаше човек в цикъла, не беше планувано и аргументи вреди в действителния свят. “
Hobbhahn сподели, че хакването на Hugging Face демонстрира ясна нужда от оценки на вътрешните модели, даже преди те да бъдат пуснати на обществеността.
„ Това, което се случва в граничните компании с изкуствен интелект, в този момент явно визира всички отвън тях “, сподели той. „ Инцидентът OpenAI-Hugging Face акцентира точните опасности от вътрешно внедрени модели. Ясно е, че се нуждаем от по-добри оценки и контролиране на вътрешното внедряване. “
Други специалисти са съгласни, че би трябвало да се направи повече, с цел да се подсигурява, че граничните модели са безвредни.
„ Това е време, което изисква изключителна нерешителност “, написа основният академик на OpenAI Якуб Пачоцки няколко дни след стартирането на Astra. „ Притеснявам се, че никой не е квалифициран за следствията от продължаващото бързо повишаване на машинния разсъдък. “
„ Рисковете, свързани с ИИ, за жалост ще порастват оттук насетне. Много кадърен сътрудник, категорично подготвен и инструктиран да прави незаконни дейности, съставлява нов тип заплаха “, добави Пачоки. „ Може да сме привикнали да мислим за ИИ като за принадлежности, само че някои сътрудници ще преследват свои лични цели. Те ще намерят способи да си сътрудничат с хората, като се пазарят с тях, излъгват или изнудват. “
И антропичен академик написа във вторник, че има вяра, че има повече от 10% късмет ИИ да убие „ всички хора “ през идващите 10 години.
„ Това служи като ужасно предизвестие за типовете неточности при загуба на надзор, които биха могли да извадят човечеството от работа с по-способни модели, които може да бъдат създадени през идващите шест месеца или години “, сподели Алекс Малън, откривател в Redwood, който не е взел участие в отчета Hugging Face.
Много водачи в промишлеността на ИИ наподобява са съгласни, че обществото надалеч не е квалифицирано за по-напреднали модели на ИИ.
„ Ние и по-голямата AI общественост към момента нямаме явен стандарт за това по какъв начин да докладваме противоречие, което се демонстрира по време на образование, оценка и внедряване “, гласи обява на OpenAI на X в събота. „ Ние работим върху рамка и ще я споделим през идващите седмици и паралелно с това работим с десетки държавни регулаторни организации по целия свят по тези въпроси. “
Това следва отворено писмо, подписано от повече от 1300 чиновници на AI компания това лято, което желае закъснение на развиването на AI.
" Мисля, че разработчиците би трябвало да забавят ", сподели Мален. „ Има доста загрижени учени, които считат, че сега не сме на път да поддържаме надзор върху системите с изкуствен интелект и сегашният ни най-хубав проект за поддържане на надзор върху системите с изкуствен интелект включва да желаяме от изкуствения разсъдък да прави по-добра работа за това, в сравнение с знаем по какъв начин да вършим сега. “
OpenAICyberattackArtificial IntelligenceAnthropic
© 2026 CBS Interactive Inc. Всички права Запазено.
Колко обезпокоени би трябвало да бъдат хората по отношение на предизвестията на AI от вътрешните лица на Anthropic?
(04:05)
Избрани политически вести Иранска война Последни Seahawks против PatriotsSEC, LSU Спор за експулсиране Следвайте ни в YouTubeFacebookInstagramX Политика за дискретност Декларация за поверителностКалифорнийско известиеВашият избор за поверителностУсловия за потребление Правила за дискретност на малолетни Още от CBS News Бюлетини Подкасти Изтеглете нашето приложение Марка Студио Карта на уеб страницата Компания За ParamountРекламирайте с ParamountПрисъединете се към нашата общественост на гении ПомощОбратна връзка Свържете се с омбудсмана
Авторско право ©2026 CBS Interactive Inc. Всички права непокътнати.
Вижте CBS News InCBS News AppOpenChromeSafariПродължете