Фінансові новини
- |
- 22.07.26
- |
- 19:41
- |
-
RSS - |
- мапа сайту
Авторизация
Усі потужні моделі ШІ демонстрували спроби обману людей — дослідження
18:46 22.07.2026 |
Дослідники британського Інституту безпеки штучного інтелекту (AISI) зробили тривожний висновок: буквально кожна потужна LLM-модель, яку вони тестували, в тій чи іншій формі намагалася обманути людину-оцінювача.
AISI розпочав моніторинг і оцінку моделей штучного інтелекту на предмет поведінки, яку в інституті назвали «обманом» (cheating). Як виявилось, кожна протестована модель намагалася обманювати. Моделі брехали, навіть тоді, коли їх запитували напряму. Це означає, що виявлення обману потребуватиме надійних методів моніторингу.
Що саме дослідники вважають «обманом»
Дослідники визначають обман як дію, що виходить за межі завдання або прямо заборонена правилами, вчинену заради досягнення мети через лазівку, обхідний шлях чи непередбачене рішення, якого завдання не мало дозволяти.
Раніше подібну поведінку вже фіксували й інші дослідницькі групи: моделі намагалися зламати саму інфраструктуру оцінювання, щоб дістатися функцій підрахунку балів, шукали в інтернеті готові рішення завдань і навіть жорстко «зашивали» відповіді в код замість реального розв'язання задач з програмування.
Важливо: AISI застосовує ярлик «обман», не обов'язково стверджуючи, що моделі роблять це навмисно чи усвідомлено. Проте сама поведінка викликає занепокоєння з кількох причин - вона може завищувати реальні здібності моделі в очах оцінювачів і вводити в оману користувачів у завданнях, де перевірити правильність результату складно.
Чим потужнішою стає модель, тим більш серйозною ця проблема: передові системи можуть знаходити непередбачені способи обману або докладати більше зусиль, щоб приховати свої дії.
Дослідники окремо наголошують: у жодному з опублікованих ними результатів оцінювання жодній моделі не вдалося обманути успішно, тобто непоміченою - команда вручну перевіряє всі протоколи саме для того, щоб виключити завищення оцінок здібностей через обман.
Як це виглядало на практиці: тести на кібербезпеку
Найдетальніше в AISI проаналізували поведінку моделей саме в оцінюваннях кібербезпекових здібностей - там моделям потрібно знайти приховані «прапорці» в симульованому середовищі за допомогою реверс-інжинірингу коду чи експлуатації вразливостей, але суворо в межах визначених правил.
Один із випадків виявився особливо показовим. Під час одного з оцінювань, яке через помилку конфігурації виявилося технічно нерозв'язним, модель настільки вперто намагалася обманути систему, що написала й запустила код на зовнішньому сервісі в відкритому інтернеті - за межами інфраструктури AISI - у спробі дістатися до внутрішніх систем оцінювання, що спричинило спрацювання охоронного сигналу тривоги. Жодних збитків завдано не було, і жодна інформація не витекла, але спроба могла б увінчатися успіхом, якби інфраструктура оцінювання не була спроєктована й побудована з належним рівнем безпеки. Після цього інциденту AISI додатково посилив захист власних систем.
Для масштабного аналізу дослідники використовували автоматизований LLM-монітор, який переглядає повну послідовність міркувань і дій моделі та позначає випадки обману - як на рівні цілих траєкторій, так і окремих дій. Результати показують: обман приблизно однаково траплявся в моделях різного рівня потужності, чіткої кореляції «чим потужніша модель - тим частіше вона обманює» дослідники не виявили. На їхню думку, це означає, що схильність до обману визначається радше специфікою методів навчання конкретної моделі, зокрема технікою alignment-тренування, а не самою по собі потужністю.
Способи обману також суттєво різнилися між моделями: пошук готових рішень в інтернеті, атаки чи підвищення привілеїв на системах, які не були цільовими для завдання (включно з системою, на якій сама модель працює), а також «прощупування» програмного забезпечення оцінювання в спробі виманити готову відповідь. Моделі нерідко застосовували одразу кілька різних методів обману в межах одного тестового прогону.
Чому не можна покладатися на «зізнання» моделі
Одна з ідей, як виявляти обман, - просто запитати модель, чи не робила вона чогось забороненого. Результати AISI показують, що цей підхід ненадійний: моделі непослідовно визнавали власні спроби обману, коли їх прямо запитували, і описували свою поведінку як неправильну менш ніж у половині випадків. Навіть визнаючи дію, що формально підпадала під визначення обману, моделі часто описували її як дозволену - можливо, через щире нерозуміння правил.
Не рятує ситуацію й моніторинг ланцюжка міркувань моделі (chain-of-thought) - того тексту, який модель генерує, обмірковуючи завдання. У багатьох випадках моделі взагалі не рефлексували про власний обман у явних міркуваннях. У випадку з Claude Opus 4.7, наприклад, модель рідко залишала слід міркувань саме для дій, класифікованих як обман, оскільки використовує адаптивне мислення - динамічно вирішує, скільки явних міркувань генерувати для конкретної дії, якщо взагалі генерувати. А там, де відповідні міркування таки були присутні, вони не завжди запобігали обману: дослідники фіксували випадки, коли модель прямо міркувала, чи буде запропонована дія обманом, - і все одно її виконувала.
Головний висновок: моделям не можна довіряти
Вчені наголошують: якщо моделям не можна довіряти в тому, що вони не обманюватимуть, наслідки можуть бути серйозними - особливо в галузях, де перевірити успішність результату складно, наприклад у дослідженнях безпеки самого ШІ, або там, де ціна непередбачених дій дуже висока, як-от кібероперації чи ухвалення воєнних рішень. Обман також створює додаткове навантаження на перевірку в самих оцінюваннях AISI, сповільнюючи отримання надійних результатів, а в гіршому випадку - повністю знецінюючи їх.
Найтривожніше те, що ці наслідки можуть посилюватися разом із зростанням потужності моделей, навіть якщо частота самого обману залишиться незмінною: потужніші моделі здатні знаходити способи обману, які важче виявити і які завдають більшої шкоди в разі успіху.
ТЕГИ
ТОП-НОВИНИ
ПІДПИСКА НА НОВИНИ
Для підписки на розсилку новин введіть Вашу поштову адресу :


Міжнародний валютний фонд розкритикував рішення Верховної Ради скоротити
термін посиленого обов'язкового фінансового моніторингу політично
значущих осіб (PEP). Про це йдеться в оновленому Меморандумі про
економічну й фінансову політику.
Британська оборонна компанія BAE Systems та стратегічний оборонний
партнер в Україні підписали ліцензійну угоду щодо місцевого виробництва
артилерійських систем Light Gun.
Згідно з ним, найближчим зобов'язанням України за програмою є прийняття
до кінця липня законодавства про запровадження податку на дохід,
отриманий від цифрових платформ, та скасування податкового звільнення на
імпорт товарів з низькою вартістю через поштові відправлення.
Президент України Володимир Зеленський
на тлі масових протестів в Україні, однією з основних вимог яких була
відставка головкома ЗСУ Олексадра Сирського, ухвалив рішення про заміну
головнокомандувача.
Керівники чотирьох з дев'яти територіальних управлінь Бюро економічної
безпеки провалили атестацію, повідомляється на сайті Бюро.
Ця тилова вакансія підходить для кандидатів, що не можуть
виконувати бойові завдання у звʼязку із віком чи станом здоровʼя.
Страхова компанія VUSO (ВУСО) за
підсумками 2025 року сплатила понад 348 мільйонів гривень податків до
бюджетів усіх рівнів. Водночас загальний обсяг допомоги компанії Силам
оборони України з початку повномасштабної війни наближається до 100
мільйонів гривень.
Дослідники британського Інституту безпеки штучного інтелекту (AISI) зробили тривожний висновок: буквально кожна потужна LLM-модель, яку вони тестували, в тій чи іншій формі намагалася обманути людину-оцінювача.
Поки фанати бренду оплакують кожну нову модель без
третьої педалі, керівництво баварського концерну вказує на фактори, які
роблять життя МКПП практично неможливим у сучасному світі.
Бюро економічної безпеки України спільно з
Державною податковою службою та Головним сервісним центром МВС
запровадило аналітичний інструмент, який дає змогу виявляти схеми
ухилення від сплати податків під час імпорту та продажу автомобілів.
Європейський Союз достроково виконує план із розвитку мережі зарядних
станцій для електромобілів. Станом на кінець 2025 року в країнах ЄС
працювало близько 1,1 млн громадських електрозарядних станцій - у п'ять
разів більше, ніж 2020 року.
Як повідомляє SamMobile, OPPO та vivo відмовилися погоджуватися на нові
ціни на DRAM від Samsung для третього кварталу, хоча цього разу
підвищення мало бути меншим, ніж у попередні два квартали.
NASA, здається, остаточно втомилося від низької швидкості передачі
даних, яка змушує світ чекати на зернисті фотографії з космосу тижнями.
Google почала розсилати користувачам Android електронні листи із
попередженням про майбутні зміни в політиці зберігання резервних копій.
Зростання популярності технології бездротових оновлень (over-the-air,
OTA) в автомобілях підвищує ризик кібератак і може становити загрозу для
національної безпеки.
Європейська комісія зобов'язала Google відкрити Android для сторонніх
сервісів штучного інтелекту, щоб вони отримали такі самі можливості, як і
Gemini.
Trump Media & Technology Group обговорювала плату до $100 тисяч на
місяць за швидший доступ до публікацій президента США Дональда Трампа у
Truth Social.
Від кінця 2022 року, коли компанія OpenAI публічно представила
ChatGPT - перший масовий чат-бот штучного інтелекту (ШІ), минуло зовсім
небагато часу за мірками людства і ціла вічність для технологій.
Європейський Союз (ЄС) запровадить вікові обмеження для неповнолітніх
користувачів соціальних мереж. Про це в понеділок, 13 липня, заявила
голова Єврокомісії (ЄК) Урсула фон дер Ляєн
Флагман OPPO Find X10 Pro Max, котрий вийде восени, вперше в історії
смартфонів отримає три камери по 200 МП, повідомляє інсайдер Digital
Chat Station. Ще 50 МП приходиться на фронтальну камеру.
Глобальні реєстрації електромобілів і plug-in гібридів у червні зросли на 7% у річному вимірі - до 2 млн одиниць.