日前中央研究院詞庫小組(CKIP)釋出的繁體中文大型語言模型,因為有網友測試後發現,AI語言模型自稱中國籍,一度引發社會爭議。
我想,這件事凸顯了台灣社會民粹又無知。
事實上,機率模型本來就不保證100%正確,況且台灣在AI、大型語言模型等新科技領域的發展,已經落後其他先進國家,現在處於追趕的過程中,我們應該給予研究者比較寬容的發展空間,在迭代中取得進步。
現在最根本問題是,我們的研究環境還不夠健全,例如,台灣很缺乏繁體中文且優質、開放訓練資料集,只能拿光華雜誌、中央日報等舊資料。但相對的,中國在網路上都有公開的訓練資料集,很可能在翻譯成繁體中文後,混進台灣的資料,這可能可以解釋網友測試的狀況。另一個可能是,用語會影響它的答案,輸入「我國國慶日」,跑出10月1號,但其實只有中國大陸會用這樣的語法提問;如果用台灣人熟悉的語句,台灣國慶日或中華民國國慶日,答案就是10月10號。
現在國際上正在發展的語言模型有幾百、幾千個,美國、中國都有它的測試資料,但台灣沒有測試資料,我們不但沒有足夠的訓練資料給研究,也沒有測試資料去引導研究往本土化的方向去走。
我們的政府應該更積極,借鏡日本經驗。OpenAI創辦人奧特曼去日本時,有答應日本政府7件事,提升日本相關的學習數據權重、提供政府公開數據分析、共享使用 LLM的學習方法等。
我之前也談過,open才能有AI,如果我們不去對大型語言模型做各種檢驗,要求它提高開放程度,它會變成另一種一言堂,讓這個世界多元性變不見。所以開源社群才會很積極要求OpenAI揭露它如何訓練模型,大眾才能對結果溯源,知道怎麼影響它,幫助世界更加開放交流。
但台灣社會現在一點都不「open」,大眾不理解語言模型特性,在產品開發過程,應該要給他們更健全的研究環境,利用這個契機理解台灣的欠缺之處,更多人參與,這種語言模型才會進步。
以Google的經驗,即使演算法上線這麼久,每個語言都還有好幾百位Reviewer,確保搜尋品質維持一致,每天評測機器跟人的距離,持續調整我們的演算法。
就連商業系統都有這麼多問題要解決,資料會歪掉、使用者行為會改變,更何況資源更缺乏的學術系統。其實這位研究員已是台灣做大型語言模型裡少數頂尖學者,應該更鼓勵、給予學術自由探索空間,避免寒蟬效應,長期下來,台灣才能更進步。