Wikimedia Indonesia/Hibah Riset Wikidata 2025/Developing an enterprise knowledge framework by integrating Private Wikibase and Public Wikidata
Nama kegiatan dan pelaksana
[edit]Developing an enterprise knowledge framework by integrating Private Wikibase and Public Wikidata
- Kemas Rahmat Saleh Wiharja, Fadil Al Afgani, dan Muhammad Aqil Ghazali Anhein
- Universitas Telkom, Bandung, Indonesia
Ringkasan kegiatan
[edit]- Apa kegiatan Anda?
Kami mengusulkan pembuatan sebuah framework yang mampu melakukan pengelolaan pengetahuan dalam berbagai format data dan yang tersebar di berbagai sistem di dalam suatu organisasi/perusahaan secara terpusat. Framework ini akan memiliki pemahaman yang komprehensif tentang semua pengetahuan perusahaan dan dapat memperbaiki kesalahan dalam basis pengetahuan (Knowledge Base/KB) perusahaan dengan merujuk informasi di dalam KB ke entitas Wikidata yang sesuai.
Komponen inti dari framework ini adalah kombinasi dari private KB yaitu Wikibase untuk menyimpan pengetahuan internal organisasi/perusahaan dan public KB Wikidata sebagai rujukan untuk memperkaya private KB. Sistem yang kami akan bangun ini memiliki fitur chatbot yang memungkinkannya untuk menanggapi pertanyaan tim internal dan pertanyaan klien eksternal dengan akurat dan kontekstual. Jika jawaban atas pertanyaan yang diberikan tidak dapat ditemukan di dalam KB, maka framework dapat terhubung ke Wikidata untuk mendapatkan informasi lebih lanjut. Fitur lainnya dari framework ini adalah mampu memperbaiki kesalahan dalam data internal dan memperkaya jawabannya ketika informasi tidak tersedia secara internal.
- Apa alasan Anda membuat kegiatan ini? Apakah manfaat / dampak kegiatan ini bagi Anda, bagi Wikimedia Indonesia/Wikidata Indonesia, dan/atau bidang keilmuan Jejaring Semantik?
Penelitian ini dibuat dengan beberapa alasan utama:
- Kebutuhan akan Sistem Manajemen Pengetahuan Terpusat — Banyak perusahaan dan organisasi memiliki pengetahuan yang tersebar di berbagai sistem dan format data yang berbeda, sehingga sulit untuk diakses dan dikelola secara efisien.
- Masalah Kualitas Data Internal — Basis pengetahuan internal seringkali mengandung kesalahan atau informasi yang tidak lengkap, yang dapat diperbaiki dengan merujuk ke sumber data eksternal yang terpercaya seperti Wikidata.
- Kebutuhan akan Respons Otomatis yang Akurat — Organisasi memerlukan sistem yang dapat merespons pertanyaan internal dan eksternal dengan akurat dan kontekstual tanpa selalu bergantung pada intervensi manual.
Manfaat/Dampak dari penelitian Bagi peneliti:
- Mengembangkan keahlian dalam bidang manajemen pengetahuan semantik
- Mendapatkan pengalaman dalam mengintegrasikan private Knowledge base dan public knowledge base
- Berkontribusi pada pengembangan teknologi AI dan intelligent chatbot
Bagi Wikimedia Indonesia/Wikidata Indonesia:
- Peningkatan Utilisasi Wikidata di Indonesia — Mendemonstrasikan penggunaan praktis Wikidata dalam konteks enterprise, yang dapat meningkatkan adopsi dan kontribusi ke ekosistem Wikimedia
- Peningkatan Utilisasi Wikibase di Indonesia — Hasil penelusuran kami di portal Wikibase, saat ini per September 2025, pengguna wikibase di Indonesia untuk perusahaan/lembaga pemerintahan/perguruan tinggi belum ada. Dengan hibah ini, kami berharap kami dapat mempopulerkan penggunaan Wikibase sebagai alat utama untuk mengelola pengetahuan di Indonesia.
- Validasi Data — Sistem ini dapat membantu mengidentifikasi kesalahan atau kekurangan dalam Wikidata untuk entri yang terkait dengan pengetahuan milik perusahaan/organisasi yang ada di dalam private KB.
- Pengembangan Komunitas — Mendorong lebih banyak organisasi untuk menggunakan dan berkontribusi pada ekosistem Wikidata
- Model Integrasi — Menjadi contoh bagaimana Wikidata dapat diintegrasikan dengan sistem internal organisasi
Bagi Bidang Keilmuan Jejaring Semantik:
- Inovasi dalam Integrasi Data — Mengembangkan metode baru untuk mengintegrasikan private KB dengan public KB
- Inovasi dalam knowledge base enrichment — Mengembangkan metode baru untuk validasi dan enrichment knowledge base.
- Peningkatan penggunaan Wikibase dalam riset internasional — Per 29 September 2025, kami cek jumlah artikel penelitian di Google Scholar yang menggunakan wikibase hanya 3370 (any time search). Jumlah ini kalah jauh dengan tool sejenis seperti Neo4J (31.400 artikel). Dengan suksesnya penelitian ini, kami berharap dapat meningkatkan gairah penggunaan wikibase di kalangan periset internasional bidang semantic web.
- Berkontribusi menghasilkan framework yang dapat digunakan oleh peneliti dan praktisi manapun untuk berbagai jenis keperluan.
- Apa yang ingin Anda capai dari kegiatan Anda? Apakah indikator keberhasilan dari proyek ini?
Target Utama:
- Working system yang mampu menjalankan semua fungsionalitas mulai dari pembangunan private KB, pendeteksian dan perbaikan kualitas pengetahuan di private KB, sampai chatbot yang mampu melakukan RAG ke private KB dan query ke public KB.
- Publikasi di International Journal of Knowledge-Based and Intelligent Engineering Systems, Q3 dengan mengandalkan beberapa kontribusi antara lain seperti penggunaan public KB (wikidata) untuk enrichment Wikibase, mekanisme RAG ke private KB
Indikator keberhasilan:
- Private KB (Wikibase) berjalan di organisasi dan memiliki coverage sebesar 90%.
- Sistem mampu menghubungkan private KB (Wikibase) dan public KB (Wikidata)
- Mengimplementasikan arsitektur dual-database dengan kemampuan validasi silang otomatis
- Sistem bisa mengidentifikasi pengetahuan mana yang perlu direvisi di dalam private KB dan kemudian merevisi pengetahuan yang ada di private KB dengan merujuk kepada induk pengetahuan di public KB.
- Chatbot berbasis AI dapat merespons pertanyaan internal dan eksternal
- Chatbot memiliki fitur Graph Retrieval system dengan kemampuan fallback ke Wikidata.
- Apa yang membuat Anda layak melaksanakan kegiatan Anda?
Kami adalah tim yang memiliki pengalaman dalam riset seputar Jejaring Semantik atau Knowledge Graph. Pemimpin tim, yaitu Kemas Rahmat Saleh Wiharja di tahun 2016-2020 melakukan riset doktoral di University of Aberdeen, UK dengan tema knowledge graph completion. Pada saat studi doktoral, beliau pernah membuat sebuah subset dataset Politik dari DBpedia. Beliau juga sampai saat ini masih aktif meneliti di bidang ontology/semanticweb/knowledge graph. Berikut adalah profil google scholar beliau. Anggota tim pertama yaitu Fadil Al Afgani pada tahun 2024 menyelesaikan tesis program magister Informatikanya di Universitas Telkom dengan tema pengkombinasian Knowledge Graph Reasoning dan Embedding. Anggota tim ketiga yaitu Aqil merupakan mahasiswa tingkat akhir dari program studi Data Science yang memiliki banyak pengalaman dalam menyelesaikan projek seputar intelligent chatbot. Kami bertiga berkomitmen menyelesaikan penelitian ini dengan tuntas dalam jangka waktu 8 bulan (Oktober 2025-Mei 2026).
- Bagaimana Anda menggunakan ekosistem Wikimedia (Wikipedia, Wikidata, dsb.) dalam proyek Anda?
Penelitian ini memanfaatkan ekosistem Wikimedia secara komprehensif sebagai backbone utama sistem knowledge management yang akan dikembangkan. Wikidata berperan sebagai sumber pengetahuan eksternal yang diakses melalui SPARQL endpoint dan REST API untuk melakukan validasi silang terhadap data internal perusahaan, sekaligus sebagai fallback mechanism ketika informasi tidak tersedia dalam knowledge base privat. Kami mengimplementasikan Wikibase sebagai private knowledge repository yang mengadopsi data model Wikidata (Items, Properties, Statements, Qualifiers) untuk menjaga konsistensi struktur data dan memungkinkan federation seamless dengan Wikidata publik. Secara teknis, sistem mengimplementasikan dual-database query architecture di mana setiap query user akan diproses melalui internal Wikibase terlebih dahulu menggunakan vector embeddings dan FAISS, kemudian jika confidence score rendah akan melakukan fallback ke Wikidata menggunakan entity linking dan graph traversal algorithms. Kami memanfaatkan Wikidata Toolkit (WDTK) untuk data processing, Wikidata JSON format untuk data exchange, dan Wikidata Query Service untuk complex semantic queries yang melibatkan relationship antar entitas. Sistem juga mengimplementasikan automated cross-validation mechanism yang membandingkan internal data dengan Wikidata untuk mengidentifikasi inconsistencies dan melakukan data enrichment otomatis. Gambaran visual dari framework kami dalam pemanfaatan ekosistem Wikimedia bisa dilihat di Gambar 1.
Kami juga akan menggunakan wikidata sebagai sumber untuk memperkaya atau meningkatkan kualitas pengetahuan di private KB kami. Silahkan lihat Gambar 2 untuk mengetahui bagaimana proses pendeteksian dan perbaikan kualitas pengetahuan di private KB dilakukan.
- Apa hal baru yang ditawarkan dari proyek yang Anda ajukan?
Research Gap yang Diidentifikasi:
Studi literatur menunjukkan bahwa mayoritas penelitian dalam domain semantic knowledge management fokus pada implementasi knowledge base dalam konteks terisolasi, baik purely private systems (seperti enterprise knowledge bases) atau purely public systems (seperti DBpedia, Freebase, atau Wikidata). Namun, terdapat celah penelitian yang signifikan dalam hal hybrid integration architecture yang menggabungkan private enterprise knowledge dengan public linked data secara seamless dengan kemampuan automated cross-validation dan quality assurance.
Aspek Keterbaruan yang Ditawarkan:
Penelitian ini menghadirkan kebaruan pada arsitektur dual-database dengan intelligent routing mechanism yang secara otomatis menentukan ketika menjawab pertanyaan pengguna di chatbot kapan menggunakan internal knowledge base dan kapan menggunakan Wikidata berdasarkan confidence scoring dan contextual relevance. Berbeda dengan pendekatan existing yang biasanya menggunakan static mapping atau manual curation, sistem kami mengimplementasikan dynamic entity linking dengan automated quality assessment yang dapat mengidentifikasi low-confidence entities dalam internal KB dan melakukan cross-validation dengan Wikidata secara real-time. Inovasi lainnya adalah bidirectional feedback mechanism yang tidak hanya mengonsumsi data dari Wikidata tetapi juga berkontribusi kembali dalam bentuk error reporting, missing data identification, dan property usage analytics yang dapat memperkaya ekosistem Wikidata Indonesia.

Gambar 1. Pendeteksian dan Perbaikan Kualitas Pengetahuan Knowledge Base

Gambar 2. Arsitektur Sistem
Jangka Waktu kegiatan
[edit]Oktober 2025 - Mei 2026
Anggaran kegiatan
[edit]Rp25.000.000
Pengalaman Publikasi Tim
[edit]TBA
Status
[edit]Permohonan ini telah DITERIMA dan akan didanai oleh Wikimedia Indonesia.
Dana telah DITURUNKAN.