Теорія "мертвого інтернету" все ближче: що показало нове дослідження

Набір тексту за ноутбуком. Фото: Unsplash

Тексти, створені або суттєво відредаговані штучним інтелектом, стають дедалі помітнішою частиною інтернету. Аналіз майже пів мільйона англомовних вебсторінок показав, що особливо швидко їхня частка зростає серед матеріалів, опублікованих після появи ChatGPT.

Про те, скільки контенту в інтернеті створюється за допомогою ШІ, пише редакція Новини.LIVE з посиланням на Pew Research Center.

Ознаки ШІ знайшли на 10% вебсторінок

Дослідники використали вебархів Common Crawl і зібрали майже 500 000 англомовних сторінок за останні п'ять років, включно з періодом до запуску ChatGPT у листопаді 2022 року.

Тексти перевірили за допомогою інструмента Open Pangram, який шукає мовні закономірності, характерні для матеріалів, створених або суттєво відредагованих штучним інтелектом.

У випадковій вибірці з 10 000 вебсторінок за липень 2026 року приблизно 10% продемонстрували значні ознаки авторства ШІ.

Дослідники зазначають, що цей показник поступово зростав після появи ChatGPT та наступного поширення інших чатботів, зокрема Claude і Gemini.

Загальний показник у 10% включає багато старих сторінок, які були опубліковані ще до появи сучасних генеративних чатботів. Якщо враховувати лише матеріали, створені після запуску ChatGPT, картина змінюється значно сильніше.

У вибірці за липень 2026 року ознаки використання ШІ виявили більш ніж у третини сторінок, опублікованих після виходу ChatGPT.

Найчастіше ознаки ШІ зустрічаються на доменах .com

ШІ-контент розподілений в інтернеті нерівномірно. Після запуску ChatGPT характерні мовні ознаки зустрічалися приблизно з однаковою частотою серед основних доменів .com, .org, .edu та .gov.

У вибірках за 2026 рік приблизно кожна десята сторінка на доменах .com демонструвала значні ознаки використання ШІ. Для .org цей показник становив 4,6%, а для доменів .edu та .gov — близько 1%.

Які слова та конструкції частіше використовує ШІ

Дослідники також порівняли мовні особливості сучасних вебсторінок із матеріалами 2023 року.

Довге тире стало використовуватися приблизно вдвічі частіше, а частота оксфордської коми зросла на 63%. Більш ніж удвічі почали частіше зустрічатися слова та вирази, характерні для текстів ШІ, серед яких "delve", "interplay", "testament", "crucial", "pivotal" та "highlight".

Майже втричі частіше почала використовуватися конструкція негативного паралелізму на кшталт "це не просто X, це Y", хоча загалом вона залишається відносно рідкісною.

Окремі слова ще не доводять використання ШІ

Автори дослідження наголошують, що системи визначення ШІ не є безпомилковими. Вони можуть помилково віднести людський текст до створеного штучним інтелектом або, навпаки, не розпізнати ШІ-контент.

Так само використання довгого тире, оксфордської коми чи окремих характерних слів саме по собі не означає, що текст створила нейромережа.

Однак під час аналізу великої кількості документів можна побачити статистичні закономірності у виборі слів, пунктуації та побудові речень, які частіше зустрічаються в матеріалах, створених за допомогою ШІ.

Раніше Новини.LIVE писали, що у Windows 11 з'являється дедалі більше функцій на основі штучного інтелекту, однак потрібні вони далеко не всім. Частину таких інструментів можна швидко вимкнути безпосередньо в налаштуваннях системи.

Також Новини.LIVE розповідали, що чатботам не варто беззастережно довіряти особисту, фінансову чи медичну інформацію. Дані, введені в ШІ-сервіси, потенційно можуть зберігатися або використовуватися надалі.