Kemampuan AI untuk memahami masyarakat bergantung pada data yang tidak hanya banyak, tetapi juga sahih secara budaya dan mewakili bahasa yang selama ini terabaikan.
Gates Foundation meluncurkan koalisi sekitar 60 organisasi untuk memperluas data bahasa bagi sistem AI. Anthropic, Google, OpenAI Foundation, dan Mozilla Data Collective termasuk di antara pihak yang terlibat. Targetnya adalah memberi dampak kepada lebih dari tiga miliar orang dalam lima tahun.
Representasi bukan sekadar penerjemahan
Model yang dilatih terutama dari sumber berbahasa dominan dapat memahami kata, tetapi kehilangan konteks sosial, ragam tutur, dan pengetahuan lokal. Mengumpulkan data yang tepat membutuhkan persetujuan komunitas, tata kelola hak, dokumentasi asal data, serta penutur yang dapat menilai mutu hasil.
AI yang benar secara tata bahasa belum tentu benar secara budaya.
Mengapa topik ini penting?
Kesenjangan bahasa menentukan siapa yang dapat memakai AI secara aman dalam kesehatan, pendidikan, pertanian, dan layanan publik. Kesalahan pada bahasa yang kurang terwakili tidak hanya mengurangi kenyamanan; dalam konteks penting, kesalahan dapat memengaruhi keputusan dan akses warga.
Pelajaran bagi Indonesia
Indonesia memiliki ratusan bahasa daerah dan peluang besar untuk membangun aset data yang bertanggung jawab. Pemerintah, kampus, media, dan komunitas perlu menetapkan persetujuan, kompensasi, lisensi, serta hak untuk menarik data. Ukuran keberhasilan bukan hanya banyaknya rekaman, tetapi manfaat nyata dan kendali masyarakat asal.
F1RSTID