我們使用AI,但沒有真正了解,它在繁體中文的功效。

去年底iKala開源AI繁體中文測試資料,來源是各類台灣國家考試題庫,GPT-4做出來的約有六十幾分,但多數開源模型考出來僅有二十幾分。這測試是四選一的選擇題,代表答對率與用猜的差不多。

但這種模型測試,如果是英文,通常可以拿到九十幾分的成績,甚至通過含申論題的醫師、律師考。

問題在於,AI的世界缺乏繁體中文的訓練及測試資料。

若說ChatGPT的訓練資料量相當於一億本書,那中文書它可能只讀了兩百萬本,其中是繁體中文的搞不好僅一、兩萬本,使AI面對繁體中文跟英文的回答能力有落差。

雖然我們可以先將問題翻成英文再去問AI,但一些本地問題,比如台灣男性兵役是幾年,就算翻成英文問,它可能還是不知道。像iKala這次拿國考題目做成測試題,科學類可能還好,但文化、法律這種本地問題,表現就差很多。

台灣是個小國,我們的資料量比不上大國,所以開源很重要。這次iKala一開源測試資料,幾天的下載量就接近1萬次,說明社群對繁體中文資料的期待。

所以要解決AI在繁體中文的能力不足,首先要有測試資料,讓繁中的AI能力可以被檢驗。

第二是盡量開放訓練資料。

簡體中文相對容易找到資料,品質未必整齊,也可能沒有授權,但約有五千萬本書的資料量,很容易在網路上取得。相反的,繁體中文資料在網路上不容易找到,因為台灣著作權法更嚴謹。

這需要政府帶頭將出版品授權,或鼓勵民間團體願意開放機器訓練使用,讓台灣及全世界社群容易取得足量的繁中訓練資料,進而鼓勵學生、工程師、科學家投入發展繁體中文AI。

而且資料可取得性越高,也有助提高繁中AI在ChatGPT、Google等大公司的發展優先性。大廠容易取得,那繁體中文的效能就會好一些。

日本最近做法就很積極,AI訓練目的的使用,可不受影像著作權保護限制,就是希望日本卡通、漫畫在未來影像世界,仍保有影響力。

同時,社會對本土研發團隊也要寬容以待,繁中資料真的太少,訓練模型很艱難,如果不能耐心包容,繁中AI科技很難進步。

假使前述資料問題始終無法解決,台灣社會就要有心理準備,以後我們用的中文語言模型,可能都是中國開發,它將不能代表台灣社會的聲音。

又或者我們只好消極的教育下一代,多用英文問問題,這將是國家文化很sad的時候。