AI tvoří téměř třetinu zkoumaných webových textů. Pro další modely to může být problém
Internet zaplňují texty vytvořené umělou inteligencí, které se mohou vracet do trénovacích dat dalších modelů. Nová studie označila za generované AI 31,1 % textových tokenů ve filtrovaném vzorku webových dat ze srpna 2026. V červnu 2024 činil jejich podíl 10,1 %.
Výzkum týmu z University of Maryland a Pangram Labs pracuje s daty Common Crawl zpracovanými pomocí filtrů kvality FineWeb. Původ textů odhadoval detektor Pangram. Číslo tedy nepopisuje celý internet ani podíl článků: měří tokeny, tedy jednotky textu používané jazykovými modely, v konkrétním vzorku.
Více textu nemusí znamenat lepší model
Autoři vytrénovali 800 jazykových modelů s různým zastoupením lidského a strojového obsahu. U modelů s nedostatkem lidských dat přidání AI textů zpočátku pomáhalo. S rostoucím množstvím však přínos slábl a mohl se změnit ve zhoršení. U modelů s větším objemem lidských dat se negativní dopad na předpovídání lidského textu projevoval téměř okamžitě.
Pro výrobce AI je to podstatná otázka: kolik dalšího obsahu má smysl zpracovat, pokud jeho přidání nepřinese odpovídající zlepšení? Samotný objem trénovacích dat pak říká méně než jejich původ, složení a vztah k úloze, kterou má model zvládnout.
Studie se přitom zabývá strojovými texty nalezenými na webu, nikoli cíleně připravenými syntetickými daty. Experimentální modely měly přibližně 20 milionů až 973 milionů parametrů, což omezuje přímé přenášení výsledků na největší současné systémy.
Filtr kvality nemusí poznat původ
Další zjištění se týká přípravy dat. AI texty procházely filtry FineWeb přibližně 2,3krát častěji než lidské dokumenty. Filtrace tedy sama o sobě nezaručuje omezení strojového obsahu.
Vzniká tím nepříjemný paradox. Obsah může splnit požadavky na formu a čitelnost, a přesto nepřinést modelu mnoho nového. Uhlazený text není automaticky zdrojem původních informací. Pro posouzení jeho hodnoty je potřeba vědět také to, odkud pochází a na čem stojí.
Původní obsah jako konkurenční výhoda
Pro firemní nasazení AI lze z výzkumu odvodit praktický podnět: věnovat větší pozornost zdrojům, se kterými systém pracuje. Studie přímo netestovala podnikové znalostní databáze, ale otázka původu informací je relevantní i pro ně.
Vlastní technická dokumentace, ověřené servisní postupy nebo zkušenosti z konkrétních projektů mohou firmě nabídnout větší užitek než další obecné texty stažené z webu. Pro dodavatele podnikových AI řešení je proto příležitostí také správa a ověřování znalostí zákazníka.
Výzkum nedokládá růst tržní ceny lidského obsahu. Podporuje však argument, že původní informace mají hodnotu, kterou pouhé množení textu nenahradí. Internet může stále snadněji produkovat další odstavce. Nové poznatky, měření a zkušenosti do nich ale musí někdo přinést.
Zdroj: arxiv.org
Zdroj ilustračního obrázku: Dan Counsell on Unsplash






