Anda mungkin pernah mendengar model kecerdasan buatan yang digambarkan sebagai "terbuka" atau "tertutup". Ini bukanlah penerangan tentang keperibadian model tersebut. AI model bahasa besar seperti yang terdapat di sebalik ChatGPT tidak mempunyai personaliti sebenar, walaupun penampilannya.
Label tersebut merujuk kepada sama ada semua maklumat tentang cara model AI berfungsi tersedia secara umum dan model tersebut boleh diubah suai, atau sama ada pembangun model merahsiakan cara kerja dalamannya dan model itu sendiri adalah hak milik persendirian.
Perisian sumber terbuka
Konsep perisian sumber terbuka berasal daripada gerakan perisian bebas pada tahun 1980-an dan 90-an. Pengasas gerakan ini percaya bahawa pencipta dan pengguna perisian mempunyai hak kepada "empat kebebasan" - untuk menjalankan program, mengkaji dan mengubah suainya, mengedarkan salinan perisian asal dan mengedarkan salinan versi yang diubah suai kemudian. Keperluan asasnya ialah kod sumber - arahan asas - untuk sesuatu program hendaklah disediakan.
Pada akhir 1990-an, pembangun perisian yang berkaitan dengan projek seperti pelayar web Netscape dan sistem pengendalian Linux telah mencipta dan mempromosikan istilah "sumber terbuka" untuk merujuk kepada cita-cita ini.
Sebagai sebahagian daripada pergerakan yang berkembang, organisasi tertentu telah membangunkan lesen sumber terbuka yang menyatakan bagaimana sekeping kod sumber tertentu boleh digunakan dan diedarkan, termasuk Lesen Awam Am Gnu, Lesen Apache, Lesen MIT dan Pengedaran Perisian Berkeley. Setiap jenis lesen juga menyatakan sebarang sekatan yang berpotensi tentang cara paten perisian digunakan pada kod sumber.
Sumber terbuka atau berat terbuka?
Idea sumber terbuka telah menjadi terkenal sekali lagi dalam beberapa tahun kebelakangan ini apabila model bahasa besar kecerdasan buatan telah melonjak, terutamanya ChatGPT OpenAI, yang dikeluarkan pada tahun 2022. Pembangun mula-mula melatih model baharu pada set data besar, kemudian menggunakan model tersebut untuk digunakan oleh orang lain.
Kecerdasan buatan sumber terbuka dijelaskan dalam masa dua minit.
Meta merupakan salah satu syarikat besar pertama yang mengeluarkan model bahasa besar sumber terbuka, yang dipanggil LLaMa. Syarikat itu mengeluarkan LLaMa pada 24 Februari 2023 dan menyediakan kod sumber "inferens" – arahan yang menjalankan model tersebut. Dan ia mengeluarkan apa yang dipanggil pemberat, pengetahuan yang dikodkan yang dipelajari oleh model semasa latihan. Walau bagaimanapun, organisasi sumber terbuka seperti Inisiatif Sumber Terbuka telah menyatakan bahawa garis panduan pelesenan LLaMa melarang penggunaan semula komersial, yang mana inisiatif itu mengekalkannya sebagai bukan sumber terbuka yang sebenar.
Syarikat lain telah mengeluarkanmodel "pemberat terbuka", seperti DeepSeek daripada DeepSeek AI dan Qwen daripada Alibaba. Model-model ini mempunyai terma penggunaan semula yang kurang ketat, dan komuniti AI telah menerima pakainya dengan pantas. Namun begitu, ramai pembangun percaya bahawa model AI sumber terbuka yang sebenar bukan sahaja mesti merangkumi kod sumber dan pemberat tetapi juga data yang digunakan untuk melatih model tersebut.
Banyak yang perlu dibuka
Takrifan Open Source Initiative tentang model AI sumber terbuka sepenuhnya merangkumi data latihan sebagai elemen utama. Walau bagaimanapun, sesetengah pembangun tertanya-tanya sejauh mana keberkesanannya untuk mengagihkan set data yang sangat besar yang diperlukan.
Jeffrey Young, Saintis Penyelidik Utama, Perkongsian untuk Persekitaran Pengkomputeran Lanjutan, Institut Teknologi Georgia
Artikel ini diterbitkan semula daripada The Conversation di bawah lesen Creative Commons. Baca artikel asal.





