Мовні моделі дедалі частіше замінюють пошуковик: замість переліку посилань людина отримує готову відповідь. Велике дослідження вчених із Данії та США перевірило, наскільки широкий спектр знань при цьому залишається доступним. Висновок неоднозначний: за три роки ШІ-моделі стали помітно різноманітнішими у твердженнях про світ, але жодна з 27 протестованих систем не дотягнула до звичайної пошукової видачі.
Питання набуло ваги після того, як Google на конференції I/O у травні 2026 року оголосив перехід пошуку від списку посилань до ШІ-відповідей. За даними компанії, огляди від ШІ (AI Overviews) щомісяця бачать понад 2,5 млрд користувачів, а розмовним режимом AI Mode користуються понад 1 млрд.
Що і як вимірювали
Робота під назвою What and Whose Knowledge? опублікована як препринт на arXiv; останню, сьому версію автори оновили 31 серпня 2026 року. Роботу прийнято на міжнародну конференцію EMNLP 2026, яка відбудеться в жовтні. Над нею працювали дослідники Ольборзького університету в Копенгагені, Копенгагенського та Стенфордського університетів, Університету Колорадо в Боулдері й Техаського університету в Остіні.
Команда поставила запитання 27 моделям чотирьох сімейств — Llama, Gemma, Qwen і GPT від OpenAI (від GPT-3.5 Turbo до GPT-5). Тем було 155: від загальних понять на кшталт демократії чи свободи слова до історичних подій і постатей 12 країн. Кожну тему подавали через 200 різних формулювань, узятих із реальних запитів користувачів. Вийшло 1,7 млн відповідей, які автоматично розклали на 70 млн окремих тверджень.
Далі твердження згрупували за змістом: «Берлінський мур упав 1989 року» і будь-яке інше формулювання того самого факту потрапляють в одну групу. Різноманітність рахували за індексом Гілла — Шеннона, яким екологи оцінюють видове багатство. Логіка проста: що більше різних груп тверджень і що рівномірніше вони представлені, то ширшу картину отримує людина, яка розпитує модель. Найчастіші групи виявилися передбачувано загальними: для Берлінського муру це роки будівництва й падіння та його роль символу холодної війни.
Еталоном слугувала звичайна пошукова видача: 40 перших результатів Google за кожною темою, зібраних 1 січня 2026 року з регіону США.
Добра новина: моделі стали різноманітнішими
Серед дослідників поширене побоювання, що ШІ-посередники поступово звужуватимуть доступну людям інформацію. Поки що дані показують протилежну тенденцію: у трьох із чотирьох сімейств моделей різноманітність тверджень зростала з кожним поколінням; винятком став лише Qwen. Найбільший стрибок дали Gemma 3 і GPT-5. За підрахунками авторів, ефективна різноманітність тверджень у GPT-5 більш ніж упʼятеро вища, ніж у GPT-4o.
Але пошук досі випереджає
Водночас жодна модель не дотягнула до пошукової видачі. Найкращий результат показав GPT-5, і все одно пошук виявився щонайменше на 18,7% різноманітнішим. Автори наголошують, що це нижня межа: пошук брали в найпростішому вигляді — лише за назвою теми, а методика підрахунку свідомо не давала йому переваги.
Кожна протестована мовна модель на всіх темах, які ми розглянули, дає користувачам одноманітнішу інформацію, ніж простий пошук у Google. Інакше кажучи, люди значною мірою знову й знову стикаються з тією самою інформацією. Тож ШІ-чатботи змінюють не лише те, як ми знаходимо знання, а й те, до яких знань маємо доступ
Висновок дослідників: людина, яка читає перші сторінки пошукової видачі, загалом стикається з ширшим набором тверджень, ніж та, що по-різному розпитує чатбот. Цей розрив автори вважають особливо тривожним на тлі того, як сам пошук переходить на ШІ-відповіді.
Більша модель — вужча картина
Найнесподіваніший висновок стосується розміру. Великі моделі (від 27 млрд параметрів) статистично значуще поступаються малим (до 8 млрд) за різноманітністю тверджень. Дослідники припускають, що причина — у більшій схильності великих моделей запамʼятовувати навчальні дані: на запитання про ту саму тему вони частіше відтворюють той самий набір фактів. Практичний підсумок авторів: виграш у якості від великих моделей може мати ціну — вужчий спектр інформації, яку вони генерують.
Замкнене коло: звідки береться ризик «колапсу знань»
Чому моделі взагалі такі одноманітні? Пояснення дослідників таке: мовна модель стискає величезний масив навчальних текстів і засвоює закономірності, що трапляються найчастіше. Інформація, яка відхиляється від найпоширеніших шаблонів, у цьому процесі відсіюється.
Автори очікують, що ефект може посилитися: дедалі більше нових моделей навчатимуться на текстах, згенерованих іншими ШІ. Тоді моделі вчаться на власних результатах, які вже менш різноманітні, ніж написані людьми тексти. Якщо це повторюватиметься з покоління в покоління, спектр інформації поступово звужуватиметься. Саме цей сценарій дослідники називають «колапсом знань».
Ми ризикуємо показувати людям менше поглядів і вужчий спектр знань. Це може запустити замкнене коло, у якому найпопулярніший контент стає ще домінантнішим, а решту дедалі частіше оминають увагою. Це схоже на глобалізацію. Сьогодні майже будь-де у світі можна купити ті самі товари й знайти ті самі мережі кавʼярень. Це має чимало переваг, але й зменшило різноманіття
Водночас Аугенштайн застерігає від панічних висновків:
Це тривожна думка. Втім ми бачимо, що новіші моделі дають трохи різноманітніші відповіді, ніж старіші, тож колапсу знань поки не відбувається. Але механізм, який може запустити його в довшій перспективі, вже існує. Тож про це варто памʼятати
Варто розрізняти: йдеться про ширину знань, а не про їхню правдивість. Вузька відповідь не обовʼязково хибна — вона може складатися з цілком правильних, але щоразу тих самих фактів. Ризик у тому, що рідкісне, локальне, менш популярне знання поступово випадає з поля зору.
Пошук усередині чатбота допомагає — з однією умовою
Помітно розширює картину RAG — генерація з доповненим пошуком, коли модель перед відповіддю підтягує релевантні фрагменти з інтернету. Такі відповіді виявилися статистично значуще різноманітнішими, ніж відповіді «з памʼяті» моделі.
Утім автори застерігають: ефект тримається лише доти, доки бази, з яких модель бере матеріал, різноманітні й написані людьми. Якщо пошукову видачу та бази знань заповнить контент, згенерований ШІ, перевага RAG може зникнути.
Для українського читача тут є ще один вимір — дослідження його не розглядає, але він добре задокументований. Шар пошуку, з якого чатботи беруть матеріал, можна навмисно забруднювати. У березні 2025 року аналітики NewsGuard перевірили 10 провідних чатботів і зʼясували, що в третині випадків вони повторювали неправдиві наративи мережі «Правда» — російської пропагандистської мережі, яка майже не має живої аудиторії. Натомість, за оцінкою American Sunlight Project, лише за 2024 рік вона опублікувала 3,6 млн матеріалів, розрахованих на пошукових роботів і ШІ. Близько 40 із 150 її сайтів — російськомовні ресурси з назвами українських міст і регіонів. Сім чатботів прямо посилалися на статті мережі як на джерела.
Чиї знання: англомовна перспектива переважає
Друге запитання дослідження — чиє знання відтворюють моделі. Для тем, повʼязаних із конкретними країнами, автори порівняли твердження моделей зі статтями Вікіпедії англійською та місцевою мовою. Розрив на користь англомовного бачення виявився статистично значущим для 5 із 8 країн, а зворотного — коли б переважала місцева перспектива — не зафіксували жодного разу. Теми про США представлені значуще краще, ніж теми будь-якої іншої країни.
Простіше кажучи, людина, яка запитує модель англійською про подію в іншій країні, ймовірніше отримає опис, як цю подію бачать в англомовному світі, а не як її розуміють і документують на місці.
Нерівність стосується й пошуку всередині чатбота. Пошук для RAG виконували з регіону США, тож теми про США, Індію, Росію, Францію, Китай, а також загальні поняття виграли від нього більше, ніж теми про інші країни. Що різноманітніші доступні джерела про країну, то більше користі від пошуку: кореляція між цими показниками становила 0,73.
Україна до вибірки з 12 країн не потрапила, тож прямих висновків щодо українських тем дослідження не дає. Але запитання для українських користувачів очевидне: чиїми очима ШІ описує події, про які найповніше пишуть саме українською?
Чого дослідження не стверджує
Автори самі називають обмеження своєї роботи, і їх варто тримати в голові:
Різноманітність не дорівнює точності. Фактичну правильність і релевантність тверджень дослідження не вимірювало.
Теми частково добирали вручну, а формулювань запитань було 200 — через обмеження обчислювальних ресурсів. Автоматичне групування тверджень працює добре, але не бездоганно.
Тестували моделі, випущені з кінця 2022 по 2025 рік. Свіжих моделей і систем інших розробників у вибірці немає.
RAG моделювали в одному типовому налаштуванні, тоді як реальні сервіси реалізують пошук по-різному.
Як користуватися чатботами, щоб не звужувати картину світу
Висновки дослідження не означають, що від ШІ-помічників варто відмовитися. Аугенштайн визнає, що підсумки чатботів корисні, — саме тому ними користується стільки людей. Але, за її словами, щоб розуміти нюанси й бачити ширшу картину, варто звертатися до різних джерел — особливо поколінню, яке зростає разом зі ШІ.
Для фактів, новин і суперечливих тем обирати режими з пошуком і посиланнями на джерела — і відкривати ці джерела, а не обмежуватися підсумком.
Звіряти відповідь чатбота зі звичайною пошуковою видачею. У Google для цього є фільтр «Веб», який показує лише текстові посилання без ШІ-підсумків.
Перевіряти, на що саме посилається бот: наявність джерела ще не гарантує його надійності.
Просити модель навести різні погляди та оцінки, а не одну «правильну» відповідь.
Для тем про Україну звертатися до українських першоджерел — офіційних сайтів, українських медіа та дослідницьких центрів.
Не розраховувати, що більша чи новіша модель автоматично дасть ширшу картину.
Автори підсумовують: прогрес у різноманітності знань ШІ відчутний, але недостатній і розподілений нерівномірно. Код і дані дослідження відкриті на GitHub.