DEV Community

Cover image for 台灣 AI 的基石不在 Token 數量:從 NSF 最新資料集計畫,看主權 AI 該怎麼投資資料
Yang Goufang
Yang Goufang

Posted on

台灣 AI 的基石不在 Token 數量:從 NSF 最新資料集計畫,看主權 AI 該怎麼投資資料

2026 年,美國國家科學基金會(NSF)發布了一個徵案計畫:Unlocking Dataset Value for AI-Enabled Scientific Discovery(暱稱 AI Datasets)。名字很長,但它的設計只有一句話,而這句話值得每一個關心台灣主權 AI 的人停下來看:

這筆最高一億美元的經費,不補助蒐集新資料,而是把「早就存在、卻讓 AI 用不動」的既有資料,升級成 AI 讀得懂的樣子。

NSF 這個計畫談的是科學研究資料,和台灣的語言、文化、主權 AI 不是同一件事。但它背後那套「與其再蒐集,不如先把既有高價值資料整備好」的投資邏輯,對正在打造正體中文 AI 基石的台灣,直接可借鏡。

所以問題不是「台灣能不能為自己的中文做一樣的事」——能,而且台灣已經開跑了。真正該想的是:我們有沒有學到 NSF 的重點,還是又走回「再蒐集一批繁中語料」的老路。


一、NSF 的重點:不是「有多少 token」,是「AI 用不用得動」

先把 NSF 的設計看清楚,因為魔鬼在細節裡:

  • 它明講不補助蒐集新資料。 NSF 直接點名問題:大量高價值資料集「not accessible, interoperable or ready to be used by automated AI systems」——不是沒有資料,而是資料沒被整理成機器與自動化 AI 讀得動的形態
  • 它補助的是「解鎖」的工程: 特徵萃取、產生詮釋資料(metadata)、跨資料集整合、建自動化資料管線、提升可近用性與互通性。
  • 規模: 最高總額 1 億美元(以近期匯率約新台幣 32 億上下),單案 200–500 萬美元,規劃型小額補助最高 20 萬美元;並與國家級 AI 資料與運算基礎設施(如 NAIRR)銜接。

一句話總結 NSF 的哲學:

瓶頸往往不是資料量,而是既有高價值資料的「AI 可用性」與治理。

把這套邏輯落到台灣,流程會長這樣——注意終點不是「資料上架」,而是「真的被用起來」:

本文建議的資料解鎖流程:既有高價值資料 → AI-ready 整備(結構化、去重、品質、隱私審查、互通)→ 可重現管線與公共平台 → 實際取用與任務價值;治理(合法授權與權利清理、來源可追溯、社群同意與退出、隱私與近用分級)貫穿全程。

而「AI 可用性(AI-ready)」不是一句口號,它是一份可檢核的清單。下面這份「AI-ready 記分卡」是本文提出的判準(非 NSF 官方規範)——每一項,光看 token 總量都答不了:

判準 Token 總量能回答嗎? 真正該公開的證據
合法可用性 ❌ 不能 授權狀態、權利清理紀錄
機器可讀性 ❌ 不能 結構化比例、OCR 品質
來源可追溯 ❌ 不能 來源、版本、處理歷程
去重與品質 ❌ 不能 重複率、錯誤率、品質抽查
隱私與安全 ❌ 不能 風險評估、近用分級
互通性 ❌ 不能 標準格式、API、共同欄位
下游價值 ❌ 不能 任務成效、外部使用案例

這一刀,正好切在台灣目前最容易被誤讀的地方。


二、台灣其實已經在做一個版本了

台灣不是從零開始。近三年,一個台版的雛形逐步成形——模型先行,語料庫與統一授權條款遲至 2025 年底才到位:

面向 台灣現況
模型 國科會 TAIDE(2023 起,以 Llama 為基礎,訓練語料規模約 600 億正體中文 token,經費逾新台幣 2 億元)、聯發創新基地 Breeze、鴻海 FoxBrain(約 700 億參數;後兩者是產業研發示範,與國家語料治理路徑平行)
語料庫 數位發展部 「臺灣主權 AI 訓練語料庫」(2025 年 12 月 beta 上線),首波約 6 億 token、2,000+ 資料集、200+ 機關參與(文化部、教育部、客委會、原民會、交通部…)
授權治理 數發部 × 經濟部智財局推出 《臺灣主權 AI 訓練語料授權條款—第 1 版》,用一套統一授權,取代逐案談著作權的高行政成本
公共算力 國家高速網路與計算中心(NCHC);民間另有台積電、鴻海等產業算力,但那是企業資源,與公共研究者可否取用是兩回事

值得肯定的是:NSF 想解決的 access(可近用)/ interoperability(互通)/ governance(治理)三件事,台灣的「主權語料庫 + 授權條款」正好就是台版的起手式——尤其在授權治理上,台灣已經開始處理「統一授權 + 集中入口」這個多數國家還在卡的環節。但要提醒:這套條款是下游的授權預設,真正的瓶頸在上游——權利清理,以及機關願不願意把資料釋出的誘因(下一節詳談)。


三、但別把「表面成績單」當成基石

台灣目前對外最醒目的成果指標,仍然是「token 數」——語料庫從 6 億繼續往上疊。這是最容易被誤讀成「基石」的地方,原因有三:

1. 用 token 總量比較,本身就不對等。
公開技術報告中,大規模通用模型的訓練 token 常達數兆量級,但那個數字含重複段落、多輪 epoch、合成資料、多語資料、不同斷詞器——和一批「乾淨、可授權、去重過」的語料放在同一把尺上比,沒有意義。所以請注意:TAIDE 的 600 億(訓練語料規模)和主權語料庫的 6 億(目前完成授權與整備的平台語料),口徑不同,不能直接相除。真正該問的不是「夠不夠大」,而是來源清不清楚、能不能合法用、是不是別處沒有、對任務有沒有價值——也就是前面那張 AI-ready 記分卡的每一欄。

2. 料的形態,常常不對。
台灣許多最有價值的內容,相當一部分仍只有掃描 PDF、缺乏結構化欄位,或欠缺可供批次使用的授權與介面——散在政府公報、判決書、辭典、館藏裡。這正是 NSF 說的那句「exists but not AI-ready」。

3. 授權的上游,還沒打通。
監察院調查報告曾指出:可優先協調釋出的政府資料集、以及以 CC0(公眾領域)開放的網站極為稀少,難以滿足主權 AI 發展的迫切需求;報告並批評 TAIDE 前導計畫缺乏系統性的資料規劃。要說明的是,「非 CC0」不等於「不能用」——其他授權條款也可能允許再利用;但這仍點出真正的病灶:授權破碎、逐案處理成本高,才是高價值資料放不出來的主因之一。

所以,真正該學 NSF 的,不是「再開一個蒐集運動」,而是把投資重心從『累積』移到『整備與治理』


四、台灣真正的差異化優勢:不是獨佔,是「更有條件做好」

如果照 NSF 的邏輯重新定義目標——不是更多 token,而是把高價值、且台灣最有條件做好的資料變得 AI 可用——台灣手上有三塊比較優勢(不是誰都做不了,而是台灣以合法取得、機構信任、第一手來源與在地品質,最有條件建立長期優勢):

① 沉睡的機構級資產。
中研院數十年的中文 NLP 基礎(平衡語料庫、CKIP)、故宮與國圖館藏、教育部辭典、司法院判決書、立法院公報、學術期刊——量並不小,但數位化程度、授權、權利歸屬與既有介面差異很大。它們不是一座均質的沉睡礦,而是該優先盤點的候選:先查清權利、格式、來源、品質與現有介面,再決定整備順序。

② 在地語言與文化資源(需社群共同治理)。
台語 / 台文、客語、原住民族語(含各語別)、新住民語言——簡中的主流訓練分佈幾乎不含這些語言中「高品質、可授權、且經社群同意」的語料。這不是「誰比較強」,而是誰握有第一手來源與治理條件,也正是「主權 AI」不可替代的理由。但要強調:這些語言與文化知識屬於社群,不是國家 AI 專案的資產。 任何納入都必須把原住民族資料主權、集體同意、近用限制、標註與利益共享放在最前面——否則就是另一種擷取。

③ 在地語境的對齊。
台灣用語、歷史脈絡、法規、氣象、地理——這些決定了模型能不能理解並尊重台灣多元社會的語境、制度與用語(而不是去定義單一「台灣人該是什麼樣」)。這是量再大的境外語料也補不上的落差。(至於健保、病歷這類敏感資料,多數目前不應預設納入訓練庫;若要納入,見下一節的嚴格前提。)


五、把國家投資,從「蒐集」改寫成「解鎖」

具體五步,把 NSF 的投資邏輯落到台灣:

  1. 新增預算優先投入整備與治理,而非累積 token。 把資源放在把既有高價值資料集數位化、加詮釋資料、去重、建自動化管線、提升互通性——並附上可檢核的 AI-ready 記分卡(合法可用性、機器可讀性、來源、隱私安全、互通性、下游價值)。
  2. 兩軌並行,不要照抄 NSF 的「不新採集」邊界。 一軌:預設優先解鎖既有高價值資料;另一軌:對確有缺口的低資源語言,做定向、以社群共識為前提的新採集。這一軌的最低標要寫進制度,不能只靠善意:(a)納入或採集前須有社群層級的同意與退出機制;(b)近用分級(研究與商業分軌);(c)利益共享寫進授權條款,不是事後再談;(d)原民會與社群代表進入治理,而不只是被列為參與機關。低資源語言常常真的沒有足夠既有素材,只靠解鎖是不夠的。
  3. 先修「授權」這個上游,而且不只是一紙預設條款。 統一授權要搭配權利清理流程:來源與權利歸屬確認、例外與第三方權利、分級近用、撤回與更正機制。敏感資料(如健保)必須以明確法源、目的限定、資料最小化、風險評估、可稽核與獨立治理為前提,而不是靠「去識別化 + 安全計算」就當作取得了合法性。
  4. 蓋一個台版的資料 + 算力平台。 把 NCHC 公共算力、主權語料庫與授權框架,整併成研究者與新創可負擔、可預期取用的國家級平台——否則資料放出來了,高成本算力仍會擋住實際使用。平台的成效指標應該是外部研究者與新創的實際取用率,而不只是上架了多少資料。
  5. 押注差異化,並排出優先序,不打通用量的仗。 資源有限,建議順序:(1)權利已清、格式接近 AI-ready 的機構級資產;(2)以社群共治為前提的低資源語言(台 / 客 / 原 / 新);(3)法源齊備的垂直領域(法律、金融),醫療放最後、且條件最嚴。做深、做到可信,而不是做廣、做到追平。

結語:基石是「質」,不是「量」

「台灣能不能為自己的中文,借鏡 NSF 那套做法?」——能,而且該做,但要說清楚:我們借鏡的是 NSF 的投資哲學(把既有高價值資料整備成 AI 可用),不是複製它的科學域邊界或徵案條款。

重點是把既有高價值資料變成 AI 用得動的樣子,再把治理、授權、算力的配套接起來。台灣真正的 AI 基石,不會來自跟境外拚繁中 token 的量,而會來自:整備沉睡的機構級資料、以社群共治守住的在地語言、以及在地語境的對齊,再用一套「開放授權 + 國家算力平台」把它們串成研究者能直接取用的地基。

數發部的主權語料庫、智財局的授權條款,已經是正確的第一步。但它到底是「蒐集運動」還是「整備平台」,有個可核對的判準:如果首波 6 億 token 多數仍是「可計數的語料」,而不是「可重現的 AI-ready 管線產出」,那指標就還偏在累積。 下一步該公開的,是 AI-ready 記分卡與整備通過率,而不只是 token 總量。

質的提升,才是基石。


參考資料(公開資訊):NSF「Unlocking Dataset Value for AI-Enabled Scientific Discovery」計畫公告(2026);數位發展部「臺灣主權 AI 訓練語料庫」新聞稿(2025/12/24)(逾 6 億 tokens、2,000+ 資料集、200+ 機關);鴻海研究院 FoxBrain(700 億參數,以 Llama 3.1 為基礎);國科會 TAIDE;經濟部智財局《臺灣主權 AI 訓練語料授權條款—第 1 版》;監察院關於 TAIDE 前導計畫與政府開放資料的調查報告。

Top comments (0)