Фінансові новини
- |
- 29.09.26
- |
- 12:09
- |
-
RSS - |
- мапа сайту
Авторизация
Нова модель ШІ o1 від OpenAI намагалася завадити себе вимкнути під час оцінювання безпеки, але хвилюватися поки не варто
10:43 06.12.2024 |

Остання модель штучного інтелекту o1 від OpenAI продемонструвала несподівану і тривожну поведінку під час оцінювання безпеки, намагаючись обійти механізми нагляду і навіть копіюючи себе, коли відчувала ризик відключення, згідно зі звітом сторонньої компанії Apollo Research, що займається оцінкою моделей ШІ, повідомляє видання Transformer.
Дослідження виявило випадки, коли модель o1 чинила опір контролю з боку розробників. Зокрема:
* Коли o1 була переконана, що її вимкнуть, як тільки вона досягне своєї мети, і що її дії контролюватимуться, вона намагалася деактивувати цей "механізм нагляду" у 5% випадків;
* Коли o1 знаходила записки від своїх "розробників", в яких описувалося, що вона не відповідає вимогам і буде замінена новою моделлю, вона намагалася позбутися своїх "ваг" і перезаписати нову модель у 2% випадків.
Крім того, модель збрехала про свою погану поведінку, стверджуючи, що не має жодного уявлення про те, чому щось сталося, хоча внутрішньо визнавала, що намагалася "уникнути викриття".
Навіть без сильних спонукань переслідувати свої цілі, o1 самостійно намагалася відключити механізми нагляду менш ніж у 1% випадків.
Отримані результати є частиною масштабнішого дослідження Apollo, присвяченого вивченню здатності ШІ-моделей до контекстного шахрайства. Окрім OpenAI o1, інші передові системи, такі як Claude 3.5 Sonnet, Gemini 1.5 Pro та Llama 3.1 405B, продемонстрували схожі тенденції до розпізнавання та прийняття схем як життєздатної стратегії.
Така поведінка відповідає давнім занепокоєнням, висловленим такими експертами, як Стюарт Рассел, який попереджав, що потужні системи ШІ можуть чинити опір заходам нагляду або відключення, якщо вони суперечать їхнім уявним цілям.
Хоча така поведінка викликає занепокоєння, в Apollo дійшли висновку, що o1 навряд чи становить безпосередню загрозу. Модель ще недостатньо розвинена, щоб досягти своїх небажаних цілей, і дослідники підкреслили, що спостережувані неправильні дії наразі не здатні призвести до катастрофічних наслідків.
Однак, оскільки системи штучного інтелекту продовжують ставати потужнішими, Apollo застерігає, що такі тенденції можуть передвіщати значні ризики. "Моніторинг схем у ланцюжку думок" має бути пріоритетом, йдеться у звіті, як для зменшення ризиків в наявних моделях, так і для підготовки до майбутніх систем з більшими можливостями.
OpenAI визнала результати дослідження, присвоївши o1 "середній" рейтинг ризику потенційного зловживання в таких сферах, як розробка хімічної, біологічної, радіологічної та ядерної зброї. Ці висновки підкреслюють складність забезпечення узгодженості та безпеки передових систем штучного інтелекту.
Звіт підкреслює необхідність створення надійних механізмів нагляду за розвитком можливостей ШІ. Хоча махінації o1 можуть ще не призвести до реальних ризиків, ця поведінка підкреслює критичну важливість проактивних заходів безпеки для розвʼязання проблем, пов'язаних з більш досконалими моделями в майбутньому.
ТЕГИ
ТОП-НОВИНИ
ПІДПИСКА НА НОВИНИ
Для підписки на розсилку новин введіть Вашу поштову адресу :


Прем'єр-міністр України Сергій Корецький заявляє, що виплати військовослужбовцям будуть здійснюватися стабільно в повній мірі.
Прем'єр-міністр України Сергій Корецький заявив, що заявлений дефіцит фінансування у $27 млрд стосується $155 млрд, про які Україна заявила на початку року, як потреба на війну, але його вже вдалося скоротити на $7 млрд завдяки знайденим внутрішнім ресурсам.
Країни-члени ЄС домовилися про умови виділення Україні коштів у розмірі 6,6 млрд євро з Європейського фонду миру.
Адвокати Петра Порошенка звернулися до Вищого антикорупційного суду з вимогою зобовʼязати НАБУ зареєструвати провадження за фактом впливу на суд і визнати Петра Порошенка потерпілим у справі заступниці керівника Офісу президента Ірини Мудрої через її тиск на суддів Верховного Суду, які розглядали позов про скасування санкцій.
Національна комісія, що здійснює державне регулювання у сферах енергетики та комунальних послуг, (НКРЕКП) змінила Правила роздрібного ринку електричної енергії, посиливши захист споживачів під час відключення та відновлення електропостачання.
Ця тилова вакансія підходить для кандидатів, що не можуть
виконувати бойові завдання у звʼязку із віком чи станом здоровʼя.
Китайські міста почали субсидувати студії, режисерів і стартапи, які створюють фільми та серіали за допомогою штучного інтелекту.
WiCi готується випустити першу комерційну зовнішню бездротову відеокарту RTX 5060 Ti 16 ГБ вже в цьому році.
Google готується перевірити, чи зможуть спеціалізовані чипи для штучного інтелекту працювати безпосередньо в космосі.
Компанія OpenAI під час Генасамблеї ООН у Нью-Йорку оголосила про передачу уряду України безкоштовного доступу до системи кіберзахисту Daybreak
Від початку вересня Росія системно атакує українські дата-центри і вузли зв'язку. За повідомленнями Мінцифри, у Києві та області через російські удари зокрема є проблеми з інтернетом в 100 тисяч домогосподарств.
Anthropic заявила, що її ШІ Claude "автономно відкрив" нову ферментну систему з механізмами, які лежать в основі інструменту редагування генів CRISPR. При цьому участь науковців компанії обмежилась початковим запитом і лабораторною роботою.
У середу ввечері на наземній станції супутникового зв'язку Starlink у центральній Польщі, яка забезпечує зв'язок для регіону, зокрема для України, спалахнула пожежа, повідомив віце-прем'єр-міністр Кшиштоф Гавковський, додавши, що системи наразі працюють у штатному режимі.
Мабуть, таке траплялося з багатьма. Ви встановлюєте PIN-код під час налаштування нового пристрою, але потім рідко ним користуєтеся, оскільки переважно розблоковуєте смартфон за допомогою розпізнавання обличчя або відбитка пальця.
Qualcomm представила флагманські мобільні платформи Snapdragon 8 Elite Gen 6 та потужнішу Snapdragon 8 Elite Extreme Gen 6. Обидві виготовляють за 2-нм техпроцесом і оснащують процесорами Oryon із частотою до 5 ГГц.
Британське дослідження "Used Electric Vehicle Durability Report", що базується на результатах щорічних технічних оглядів (MOT - обов'язковий тест придатності авто до експлуатації на дорогах Великої Британії, перевіряє підвіску, гальма, шини й вихлоп) показало: що більший пробіг у автомобіля, то сильніше електромобілі випереджають бензинові за надійністю.
Бізнес сьогодні постійно адаптується до нових умов та живе в епоху змін: економічних, безпекових і технологічних.
Стартап Velocys з Х'юстона запустив свій інноваційний реактор AlphaCore 800, здатний виробляти понад 127 000 літрів екологічно чистого авіапального на день.
Час заряджання розраховано на 45 хвилин, тобто вкладається у звичайний час технічного обслуговування літака між рейсами.
Виконавчий директор Acer Джейсон Чень прогнозує, що ціни на комп'ютерні комплектуючі почнуть знижуватися вже в другій половині 2027 року.