Selama 30 tahun, web seluruh dunia telah berjalan berdasarkan kontrak sosial yang sangat mendalam: kebanyakan laman web adalah percuma untuk diakses oleh enjin carian, tetapi jika anda menggunakan kandungannya, anda memberi penghargaan dengan memautkan ke sumbernya.
Baru-baru ini, kontrak sosial itu mula runtuh. Alat kecerdasan buatan (AI) merayapi laman web bukan untuk memautkannya, tetapi untuk melatih model dan menjana jawapan (yang mungkin tepat atau tidak).
Apabila anda mencari sesuatu, respons ChatGPT atau Gambaran Keseluruhan AI Google mungkin masih merangkumi pautan ke sumber, tetapi ia merupakan sejenis tambahan pilihan kepada jawapan utama.
Ini telah mencetuskan dinamik buruk bagi pemilik laman web, orang ramai, malah syarikat AI itu sendiri: apabila laman web kehilangan trafik (dan pendapatan), banyak yang mula menyekat alat pengikis AI, yang bermaksud hasil AI lebih bergantung pada laman web berkualiti rendah (kebanyakannya juga dijana oleh AI). Akibatnya, maklumat yang baik boleh menjadi lebih sukar berbanding sebelum ini untuk dicari.
Bagaimana kami sampai di sini
Pada zaman awal web di seluruh dunia, enjin carian dan pencipta kandungan telah mencapai persetujuan tentang perayapan (amalan memeriksa tapak secara teknologi untuk mengindeksnya, supaya ia boleh dipaparkan dalam hasil carian). Pencipta kandungan akan menyediakan akses ke tapak mereka secara percuma, dan juga membenarkan enjin carian menghasilkan semula petikan teks yang kecil.
Sebagai balasan, enjin carian menyediakan pautan ke laman web yang dimiliki oleh pencipta kandungan, yang mendapat manfaat daripada trafik web tersebut. Jika pencipta kandungan tidak menyukai tawaran itu, mereka boleh menghalang enjin carian daripada merayapi laman web mereka dengan arahan dalam fail yang dipanggil robots.txt.
Tetapi jika alatan AI tidak lagi menyediakan trafik web, ia akan mengurangkan pencipta kandungan daripada gelung ekonomi. Terdapat juga kos lain yang berkaitan dengan setiap lawatan ke laman web, jadi perayapan AI boleh menyebabkan pembekal laman web menanggung kos sambil tidak memberi mereka sebarang iklan atau pendapatan lain yang akan datang daripada trafik manusia. Perayap AI juga merangkak dengan lebih mendalam dan lebih intensif daripada perayap web tradisional, sekali gus meningkatkan kos tersebut.
Perubahan corak trafik ini bukanlah masalah kecil atau hipotetikal. Cloudflare, sebuah syarikat pengehosan dan perkhidmatan web yang mengurus 30% atau lebih daripada 10,000 laman web teratas di internet, menganggarkan lebih separuh daripada semua trafik web kini adalah bot AI.
Sebahagian daripadanya akan menjadi ejen AI yang diselia secara langsung oleh orang ramai, tetapi kebanyakannya adalah perayap. Pemilik tapak boleh menggunakan robots.txt untuk meminta perayap AI supaya tidak melayari tapak mereka – tetapi sesetengah syarikat AI mungkin mengabaikan permintaan sopan ini.
Jika syarikat AI memenuhi permintaan tersebut, itu boleh menimbulkan masalah yang berbeza. Laman web yang mengandungi maklumat salah adalah kurang berkemungkinan untuk mengharamkan perayap AI, jadi jawapan AI tidak akan dimaklumkan oleh sumber yang berkualiti tinggi.
Apa yang berlaku dalam jangka pendek
Akan datang satu peristiwa yang digelar "Google Zero" – hari di mana trafik terus daripada Google berkurangan. Walaupun sesetengah orang yang berambut perang (seperti salah seorang penulis artikel ini) mungkin masih mengklik untuk mengesahkan jawapan AI, trafik ini semakin berkurangan, akibat langsung daripada ringkasan AI.
Satu kajian terhadap Wikipedia mengesahkan perkara ini, menunjukkan bahawa trafik dalam versi bahasa Inggeris laman web tersebut menurun dengan cepat dengan pelancaran ringkasan AI di Google dalam bahasa Inggeris, dan corak yang sama berlaku dalam bahasa lain apabila ringkasan AI dilancarkan. Tidak perlu mengklik untuk mendapatkan jawapan mungkin kelihatan hebat bagi pencari maklumat, tetapi realitinya lebih kompleks.
Banyak laman web kini menyekat perayap AI sama sekali. Pemilik laman web yang memutuskan untuk menyekat perayap AI kurang berkemungkinan dipautkan dalam jawapan Gambaran Keseluruhan AI, walaupun alat AI masih boleh mengakses kandungan untuk mengasaskan jawapannya (menggunakan teknik yang dipanggil penjanaan tambahan pengambilan semula).
alternatif "bayar untuk merangkak" telah dicadangkan sebagai cara untuk memberi pampasan kepada pencipta kandungan, tetapi masih belum mendapat sambutan.
Menjelang 15 September, laman web Cloudflare akan menyekat perayap AI secara lalai pada halaman yang mengandungi pengiklanan (dan oleh itu menjana wang untuk pencipta kandungan).
Ini bermakna sehingga 30% daripada laman web teratas dunia tidak lagi akan muncul dalam ringkasan Gambaran Keseluruhan Google AI. Ini juga bermakna bahawa kebanyakan perkara yang dilatih untuk AI itu sendiri akan menjadi teks yang dijana oleh AI.
Apa maksudnya untuk anda
Jadi apakah maksudnya apabila anda mencari maklumat? Kualiti ringkasan AI berkemungkinan akan menurun, sekurang-kurangnya dalam jangka pendek, sementara ekonomi baharu web diselesaikan.
Ini akan berlaku atas dua sebab. Yang pertama ialah kandungan berkualiti tinggi kurang berkemungkinan dimasukkan ke dalam ringkasan AI tersebut – satu kajian baru-baru ini mendapati bahawa kira-kira 1 daripada 6 sumber yang digunakan oleh alat carian AI itu sendiri merupakan laman web yang dijana AI.
Sebab kedua ialah, apabila model AI dilatih menggunakan lebih banyak teks AI, outputnya mungkin merosot (fenomena yang dikenali sebagai keruntuhan model).
Hasilnya, enjin carian yang kurang bergantung pada AI mungkin menjadi lebih andal. Cabarannya adalah mencari enjin carian yang tidak menggunakan crawler berasaskan AI. Ia memang wujud: ZDNet mengesyorkan Mojeek, PCMag mengesyorkan Bravedan Ban the Bots menyenaraikan beberapa, termasuk satu khusus untuk kandungan "pengeluar kecil" seperti blog.
Buat masa ini, apa sahaja enjin carian yang anda gunakan, perkara terbaik yang boleh anda lakukan ialah menatal ke bawah dan mengklik pada beberapa hasil carian sebenar. Ini memberi manfaat kepada pencipta kandungan, dan juga lebih berkemungkinan memberi anda maklumat yang lebih tepat.
Dana McKay, Dekan Madya, Interaksi, Teknologi dan Maklumat, Universiti RMIT
Damiano Spina, Pensyarah Kanan, Sekolah Teknologi Pengkomputeran, Universiti RMIT
Artikel ini diterbitkan semula daripada The Conversation di bawah lesen Creative Commons. Baca artikel asal.





