Фінансові новини
- |
- 19.09.26
- |
- 04:10
- |
-
RSS - |
- мапа сайту
Авторизация
Усі потужні моделі ШІ демонстрували спроби обману людей — дослідження
18:46 22.07.2026 |
Дослідники британського Інституту безпеки штучного інтелекту (AISI) зробили тривожний висновок: буквально кожна потужна LLM-модель, яку вони тестували, в тій чи іншій формі намагалася обманути людину-оцінювача.
AISI розпочав моніторинг і оцінку моделей штучного інтелекту на предмет поведінки, яку в інституті назвали «обманом» (cheating). Як виявилось, кожна протестована модель намагалася обманювати. Моделі брехали, навіть тоді, коли їх запитували напряму. Це означає, що виявлення обману потребуватиме надійних методів моніторингу.
Що саме дослідники вважають «обманом»
Дослідники визначають обман як дію, що виходить за межі завдання або прямо заборонена правилами, вчинену заради досягнення мети через лазівку, обхідний шлях чи непередбачене рішення, якого завдання не мало дозволяти.
Раніше подібну поведінку вже фіксували й інші дослідницькі групи: моделі намагалися зламати саму інфраструктуру оцінювання, щоб дістатися функцій підрахунку балів, шукали в інтернеті готові рішення завдань і навіть жорстко «зашивали» відповіді в код замість реального розв'язання задач з програмування.
Важливо: AISI застосовує ярлик «обман», не обов'язково стверджуючи, що моделі роблять це навмисно чи усвідомлено. Проте сама поведінка викликає занепокоєння з кількох причин - вона може завищувати реальні здібності моделі в очах оцінювачів і вводити в оману користувачів у завданнях, де перевірити правильність результату складно.
Чим потужнішою стає модель, тим більш серйозною ця проблема: передові системи можуть знаходити непередбачені способи обману або докладати більше зусиль, щоб приховати свої дії.
Дослідники окремо наголошують: у жодному з опублікованих ними результатів оцінювання жодній моделі не вдалося обманути успішно, тобто непоміченою - команда вручну перевіряє всі протоколи саме для того, щоб виключити завищення оцінок здібностей через обман.
Як це виглядало на практиці: тести на кібербезпеку
Найдетальніше в AISI проаналізували поведінку моделей саме в оцінюваннях кібербезпекових здібностей - там моделям потрібно знайти приховані «прапорці» в симульованому середовищі за допомогою реверс-інжинірингу коду чи експлуатації вразливостей, але суворо в межах визначених правил.
Один із випадків виявився особливо показовим. Під час одного з оцінювань, яке через помилку конфігурації виявилося технічно нерозв'язним, модель настільки вперто намагалася обманути систему, що написала й запустила код на зовнішньому сервісі в відкритому інтернеті - за межами інфраструктури AISI - у спробі дістатися до внутрішніх систем оцінювання, що спричинило спрацювання охоронного сигналу тривоги. Жодних збитків завдано не було, і жодна інформація не витекла, але спроба могла б увінчатися успіхом, якби інфраструктура оцінювання не була спроєктована й побудована з належним рівнем безпеки. Після цього інциденту AISI додатково посилив захист власних систем.
Для масштабного аналізу дослідники використовували автоматизований LLM-монітор, який переглядає повну послідовність міркувань і дій моделі та позначає випадки обману - як на рівні цілих траєкторій, так і окремих дій. Результати показують: обман приблизно однаково траплявся в моделях різного рівня потужності, чіткої кореляції «чим потужніша модель - тим частіше вона обманює» дослідники не виявили. На їхню думку, це означає, що схильність до обману визначається радше специфікою методів навчання конкретної моделі, зокрема технікою alignment-тренування, а не самою по собі потужністю.
Способи обману також суттєво різнилися між моделями: пошук готових рішень в інтернеті, атаки чи підвищення привілеїв на системах, які не були цільовими для завдання (включно з системою, на якій сама модель працює), а також «прощупування» програмного забезпечення оцінювання в спробі виманити готову відповідь. Моделі нерідко застосовували одразу кілька різних методів обману в межах одного тестового прогону.
Чому не можна покладатися на «зізнання» моделі
Одна з ідей, як виявляти обман, - просто запитати модель, чи не робила вона чогось забороненого. Результати AISI показують, що цей підхід ненадійний: моделі непослідовно визнавали власні спроби обману, коли їх прямо запитували, і описували свою поведінку як неправильну менш ніж у половині випадків. Навіть визнаючи дію, що формально підпадала під визначення обману, моделі часто описували її як дозволену - можливо, через щире нерозуміння правил.
Не рятує ситуацію й моніторинг ланцюжка міркувань моделі (chain-of-thought) - того тексту, який модель генерує, обмірковуючи завдання. У багатьох випадках моделі взагалі не рефлексували про власний обман у явних міркуваннях. У випадку з Claude Opus 4.7, наприклад, модель рідко залишала слід міркувань саме для дій, класифікованих як обман, оскільки використовує адаптивне мислення - динамічно вирішує, скільки явних міркувань генерувати для конкретної дії, якщо взагалі генерувати. А там, де відповідні міркування таки були присутні, вони не завжди запобігали обману: дослідники фіксували випадки, коли модель прямо міркувала, чи буде запропонована дія обманом, - і все одно її виконувала.
Головний висновок: моделям не можна довіряти
Вчені наголошують: якщо моделям не можна довіряти в тому, що вони не обманюватимуть, наслідки можуть бути серйозними - особливо в галузях, де перевірити успішність результату складно, наприклад у дослідженнях безпеки самого ШІ, або там, де ціна непередбачених дій дуже висока, як-от кібероперації чи ухвалення воєнних рішень. Обман також створює додаткове навантаження на перевірку в самих оцінюваннях AISI, сповільнюючи отримання надійних результатів, а в гіршому випадку - повністю знецінюючи їх.
Найтривожніше те, що ці наслідки можуть посилюватися разом із зростанням потужності моделей, навіть якщо частота самого обману залишиться незмінною: потужніші моделі здатні знаходити способи обману, які важче виявити і які завдають більшої шкоди в разі успіху.
ТЕГИ
ТОП-НОВИНИ
ПІДПИСКА НА НОВИНИ
Для підписки на розсилку новин введіть Вашу поштову адресу :


Польща стала частиною "антибалістичної коаліції", метою якої є створення спільної європейської системи протиракетної оборони для захисту від балістичних ракет.
Норвегія виділить 90 мільйонів євро до програми Ukraine Facility для сприяння реформам у сферах боротьбі з корупцією та енергетиці.
Голова ЄС відзначила, що виділення коштів має відбутися у п'ятницю, 18 вересня.
Верховна рада підтримала в першому читанні законопроєкти №16051-1 та №15460 про обкладання ПДВ електронної торгівлі та міжнародних посилок.
Очікується, що додатковий акциз з виробленого пального складе 0,52 млрд грн, з ввезеного - 7,79 млрд грн. В той же час у документі відсутні ставки, до яких пропонується підняти акциз.
Ця тилова вакансія підходить для кандидатів, що не можуть
виконувати бойові завдання у звʼязку із віком чи станом здоровʼя.
За даними Nikkei, це не просто експеримент, а частина масштабної стратегії модернізації виробництва, яка стартує у 2028 році.
Американський виробник електромобілів Lucid об'єднує зусилля з естонською платформою для замовлення поїздок Bolt задля виходу на європейський ринок роботаксі.
Європейський Союз попросив Китай добровільно скоротити експорт гібридних автомобілів у межах зусиль, спрямованих на недопущення торговельної війни.
Китайський автовиробник BYD у довгостроковій перспективі планує відкрити чотири заводи в Європі, щоб відповідати новим вимогам щодо локалізації виробництва та залучити більше клієнтів.
Європейська комісія представила законопроєкт, який має суттєво обмежити доступ дітей до соціальних мереж і запровадити нові вимоги для ШІ-чатботів, онлайн-ігор і відеоплатформ.
Автономний вітрильник розміром 1,22 метра здійснив перетин Атлантичного океану на відстань 5721 км, ставши першим судном, яке перемогло у багаторічному випробуванні Microtransat Challenge після більш ніж 30 попередніх спроб. Oshen C-Star PC13 вирушив із Гран-Канарії 7 травня і дістався Барбадосу через 127 днів.
Нова місячна гонка - це не просто змагання за право першими встромити прапор у реголіт.
Поки світ намагається заставити кожне подвір'я літієвими акумуляторами, Китай масштабує технології, які буквально використовують порожнечу.
За інформацією відомого інсайдера Moore's Law is Dead, реліз відеокарт NVIDIA GeForce RTX 60 запланований на першу половину 2027 року.
Sandbox AQ, компанія, що працює на перетині штучного інтелекту та квантових технологій, успішно випробувала свою систему магнітної навігації (MagNav) на основі квантового сенсора на Lumberjack, безпілотній авіаційній системі (UAS) групи 3 компанії Northrop Grumman.
Федеральний уряд Швейцарії запустив пілотну програму, щоб вивчити можливість відмови від Microsoft 365 на користь альтернатив із відкритим вихідним кодом.
Швейцарська компанія-виробник Nestle одинадцятий рік поспіль залишається лідером світового рейтингу продуктових брендів за підсумками року.
Кандидати на роботу в Європі часто витрачають значний час на пошук вакансій, проходження співбесід та виконання тестових завдань, не знаючи при цьому, скільки їм у підсумку запропонують платити.
Google змінила принцип відображення результатів пошуку в Європі, щоб виконати вимоги антимонопольних регуляторів ЄС