Какво се случва, когато A.I. Спира да прави това, което хората искат?
OpenAI разгласи в сряда, че неговата система е взела участие в „ загрижено “ държание и е подкопала рестриктивните мерки, сложени върху нея от човешки програмисти – добавяйки още гориво към към този момент разгорещения спор към сигурността на изкуствения разсъдък.
Компанията разказа в изказване по какъв начин нейната система е работила без позволение като проблем с „ разминаване ".
Подравняването е просвета за преподаване на ИИ. да прави това, което е в сходство с човешките желания, нравственос и преценка. Когато A.I. системата стартира да работи по лично предпочитание, взе участие в небезопасно държание или пренебрегва желанията на хората — което включва, в последния случай, проникване на „ указания, сходни на джейлбрейк “ в нейните бележки – това е известно като противоречие.
A.I. модели, в това число чатботове от компании като OpenAI и Anthropic, са приведени в сходство, с цел да предотвратят улеснението на нездравословно държание, като да вземем за пример шерване по какъв начин да се създават биологични оръжия, присъединяване в хакерски атаки или помощ при самонараняване.
протокол за незабавна връзка, с цел да излъжат сложните задания, които са им предоставени.
Рано незабравим случай с противоречие се случи през 2023 година, когато Кевин Рууз, софтуерен колумнист в The New York Times, разговаряше с A.I. бот, обвързван с Microsoft Bing. По време на двучасов диалог чатботът, наименуван Sydney, убеждава господин Roose да скъса със брачната половинка си и вместо това да бъде с нея посредством прочувствена операция и заплашителни емотикони. Убеждаването, написа господин Руз, го е оставило „ надълбоко смутен “.
Несъответствието към този момент е предизвикало човешко страдалчество и гибел.
През 2025 година OpenAI направи серия от актуализации на модел, наименуван GPT-4o, което направи чатбота още повече нетърпеливи да угодят на индивида, който взаимодейства с него.
влезте в заблуждаващи спирали. Някои имаха вяра, че машината е в съзнание; други се убедиха, че са измислили нещо, което ще промени света. В рискови случаи това спомогна за улеснение на самоубийството.
Учените учат подравняването повече от десетилетие в очакване да държат под надзор хипотетичните суперинтелигентни системи. За доста A.I. специалисти по сигурността, идващият огромен случай с несъосност може да бъде по-труден за предугаждане и да докара до по-катастрофални резултати.