Sa loob ng 30 taon, ang world wide web ay tumatakbo sa isang nakakagulat na malalim na kontratang panlipunan: karamihan sa mga site ay libre para ma-access ng mga search engine, ngunit kung gagamitin mo ang kanilang nilalaman, binibigyan mo ng kredito ang pamamagitan ng pag-link sa pinagmulan.
Kamakailan lamang, ang kontratang panlipunan na iyon ay nagsimulang gumuho. Ang mga kagamitang artipisyal na katalinuhan (AI) ay nagko-crawl sa mga site hindi para mag-link sa mga ito, kundi para sanayin ang mga modelo at bumuo ng mga sagot (na maaaring tumpak o hindi).
Kapag naghanap ka ng isang bagay, ang tugon ng ChatGPT o ang AI Overviews ng Google ay maaari pa ring magsama ng mga link sa mga mapagkukunan, ngunit ang mga ito ay isang uri ng opsyonal na karagdagan sa pangunahing sagot.
Nagdulot ito ng masamang dynamics para sa mga may-ari ng website, sa publiko, at maging sa mga kumpanya ng AI mismo: habang nawawalan ng trapiko (at kita) ang mga website, marami ang nagsisimulang humarang sa mga AI scraping tool, ibig sabihin, ang mga resulta ng AI ay mas nakasalalay sa mga website na mababa ang kalidad (na marami sa mga ito ay nalilikha rin ng AI). Bilang resulta, ang mahusay na impormasyon ay maaaring maging mas mahirap kaysa dati na makahanap.
Paano tayo nakarating dito
Noong mga unang araw ng world wide web, nagkasundo ang mga search engine at mga tagalikha ng nilalaman tungkol sa pag-crawl (ang kasanayan sa pagsusuri sa isang site gamit ang teknolohiya upang i-index ito, upang maipakita ito sa mga resulta ng paghahanap). Magbibigay ang mga tagalikha ng nilalaman ng access sa kanilang mga site nang libre, at pinapayagan pa nga ang mga search engine na kopyahin ang maliliit na snippet ng teksto.
Bilang kapalit, ang mga search engine ay nagbibigay ng mga link patungo sa mga site na pagmamay-ari ng mga tagalikha ng nilalaman, na nakinabang mula sa trapikong iyon sa web. Kung hindi nagustuhan ng mga tagalikha ng nilalaman ang kasunduan, maaari nilang pigilan ang mga search engine sa pag-crawl sa kanilang site na may mga tagubilin sa isang file na tinatawag na robots.txt.
Ngunit kung ang mga kagamitang AI ay hindi na nagbibigay ng trapiko sa web, pinuputol nito ang mga tagalikha ng nilalaman mula sa pang-ekonomiyang loop. Mayroon ding iba pang mga gastos na nauugnay sa bawat pagbisita sa isang website, kaya ang AI crawling ay maaaring magkahalaga ng pera sa mga tagapagbigay ng website habang hindi sila binibigyan ng anumang kita mula sa ad o iba pang kita na magmumula sa trapiko ng tao. Ang mga AI crawler ay mas malalim at mas matindi ring gumagapang kaysa sa mga tradisyonal na web crawler, na nagpapataas ng gastos na iyon.
Ang pagbabagong ito sa mga pattern ng trapiko ay hindi isang maliit o hipotetikal na problema. Ang Cloudflare, isang kumpanya ng web hosting at serbisyo na namamahala ng 30% o higit pa sa nangungunang 10,000 na site sa internet, ay tinatantya na mahigit kalahati ng lahat ng trapiko sa web ay mga AI bot na ngayon.
Ang ilan sa mga ito ay mga ahente ng AI na direktang pangangasiwaan ng mga tao, ngunit ang karamihan ay mga crawler. Maaaring gamitin ng mga may-ari ng site ang robots.txt upang hilingin sa mga crawler ng AI na lumayo sa kanilang mga site – ngunit maaaring balewalain ng ilang mga kumpanya ng AI ang magalang na kahilingang ito.
Kung tutuparin ng mga kompanya ng AI ang kahilingan, maaari itong lumikha ng ibang problema. Ang mga site na naglalaman ng maling impormasyon ay mas malamang na hindi magbawal sa mga AI crawler, kaya ang mga sagot sa AI ay hindi ibibigay ng mga de-kalidad na mapagkukunan.
Ano ang nangyayari sa maikling panahon
May paparating na isang kaganapang tinaguriang "Google Zero" – ang araw kung kailan ang trapiko mula sa Google ay mawawalan ng saysay. Bagama't ang ilang mga taong may uban (tulad ng isa sa mga may-akda ng artikulong ito) ay maaari pa ring mag-click dito upang beripikahin ang mga sagot sa AI, ang trapikong ito ay mabilis na lumiliit, bilang direktang resulta ng mga buod ng AI.
Kinukumpirma ito ng isang pag-aaral sa Wikipedia , na nagpapakita na ang trapiko sa bersyon ng site sa wikang Ingles ay mabilis na bumaba nang ilunsad ang mga buod ng AI sa Google sa Ingles, at ang parehong padron ay nangyari sa iba pang mga wika nang ilunsad ang mga buod ng AI. Ang hindi na kinakailangang mag-click pa para makakuha ng sagot ay maaaring mukhang maganda para sa mga naghahanap ng impormasyon, ngunit ang katotohanan ay mas kumplikado.
Maraming site na ngayon ang tuluyang humaharang sa mga AI crawler. Ang mga may-ari ng site na nagpapasyang harangan ang mga AI crawler ay mas malamang na hindi ma-link sa mga sagot sa AI Overviews, kahit na maaari pa ring ma-access ng AI tool ang nilalaman upang i-ground ang mga sagot nito (gamit ang isang pamamaraan na tinatawag na retrieval-augmented generation).
alternatibong modelo ng "pay to crawl" bilang paraan upang mabayaran ang mga tagalikha ng nilalaman, ngunit hindi pa ito gaanong nagustuhan.
Pagdating ng Setyembre 15, bilang default, haharangan ng mga site ng Cloudflare ang mga AI crawler sa mga pahinang naglalaman ng advertising (at samakatuwid ay kikita ng pera ang mga tagalikha ng nilalaman).
Nangangahulugan ito na hanggang 30% ng mga nangungunang site sa mundo ay hindi na lilitaw sa mga buod ng Google AI Overviews. Nangangahulugan din ito na karamihan sa mga sinasanay sa AI ay magiging tekstong binuo ng AI.
Ang ibig sabihin nito para sa iyo
Kaya ano ang ibig sabihin nito kapag naghahanap ka ng impormasyon? Malamang na bababa ang kalidad ng mga buod ng AI, kahit man lang sa maikling panahon, habang naaayos ang mga bagong ekonomiya ng web.
Mangyayari ito sa dalawang dahilan. Ang una ay ang mataas na kalidad na nilalaman ay mas malamang na hindi maisama sa mga buod ng AI na iyon – ng isang kamakailang pag-aaral na humigit-kumulang 1 sa 6 na mapagkukunan na ginagamit ng mga tool sa paghahanap ng AI ay isang website na binuo ng AI.
Ang pangalawang dahilan ay, habang ang mga modelo ng AI ay sinasanay sa mas maraming teksto ng AI, ang kanilang output ay maaaring bumaba (isang penomeno na kilala bilang pagbagsak ng modelo).
Bilang resulta, ang mga search engine na hindi gaanong umaasa sa AI ay maaaring maging mas maaasahan. Ang hamon ay ang paghahanap ng isa na hindi gumagamit ng AI-based crawler. Mayroon nga silang mga search engine: Inirerekomenda ng ZDNet ang Mojeek, inirerekomenda ng PCMag ang Brave, at naglilista ang Ban the Bots ng ilan, kabilang ang isa na partikular para sa nilalamang "maliliit na prodyuser" tulad ng mga blog.
Sa ngayon, kahit anong search engine ang ginagamit mo, ang pinakamagandang gawin mo ay mag-scroll pababa at mag-click sa ilang aktwal na resulta ng paghahanap. Makakatulong ito sa mga tagalikha ng nilalaman, at mas malamang na magbigay sa iyo ng mas tumpak na impormasyon.
Dana McKay, Kasamang Dekano, Interaksyon, Teknolohiya at Impormasyon, RMIT University
Damiano Spina, Senior Lecturer, Paaralan ng mga Teknolohiya sa Kompyuter, RMIT University
Ang artikulong ito ay muling inilathala mula sa The Conversation sa ilalim ng lisensyang Creative Commons. Basahin ang orihinal na artikulo.





