快訊

沙德爾減弱成低壓陰魂不散靠近台灣 粉專點「這些地區」明起防劇烈降雨

低薪「台灣病」被經濟榮景掩蓋? 柯文哲提1治療處方

直擊/慟!家屬盼陳盈潔放下辛苦 告別式花籃眾星曝光

資服等業者申請使用主權AI訓練語料庫 數發部擴增民間內容

資料是人工智慧(AI)發展的重要基礎,台灣主權AI訓練語料庫自去年底上線,累計提供約5000筆資料集、超過20億詞元(tokens)。數發部表示,已有59名個人或單位申請使用,包括凌群、華碩等業者;目前少量民間語料已上架,預計9月中旬啟動民間語料徵集。

數發部推動台灣主權AI訓練語料庫,廣納高品質、具在地化的正體中文語料,內容涵蓋文化、教育、語言、民俗、歷史、交通、法律及各領域專業知識,支援AI模型訓練與應用發展。語料庫去年底上線,截至今年7月底,已有超過200個政府機關參與,累計提供約5000筆資料集,語料規模超過20億詞元。

數發部指出,目前語料徵集採「先中央再地方,逐步擴展至民間」策略,民間累積豐富且具台灣特色的出版、文化及各領域專業內容,是讓AI更深入理解台灣的重要高品質語料來源,因此今年下半年起積極接洽出版社、法人等民間單位,目前已有少量民間語料上架。

數發部說明,預計9月中旬啟動民間語料徵集,現階段民間語料以自願、無償提供為原則,並採「台灣主權AI訓練語料授權條款」上架至語料庫,讓資料在合法授權前提下提供AI訓練使用。

數發部表示,已有59名個人或單位申請使用台灣主權AI訓練語料庫並通過審核,包括5個研究機構、22所學校、2個政府機關、7名個人、3個社群,以及20家公司與組織,其中以資訊服務業者為大宗,包括亞太智能、凌群、應援科技、華碩等,另有環境與藝術、能源等產業。語料庫開放產學研及民間使用,可用於模型訓練、微調、檢索增強生成(RAG)等。

數發部指出,從申請者填寫的使用目的及需求來看,教育部字辭典類語料的應用需求較明顯,如台灣客語辭典、台灣台語常用詞辭典及國語辭典簡編本等。此外,機關FAQ及教育學習相關語料也受到關注,常見應用情境包括語言學習、知識問答、RAG及智慧客服等。

數發部進一步說,國科會TAIDE團隊已申請使用語料庫資料,作為模型訓練與優化的資料來源之一,預計今年發布運用語料庫資料訓練的新版模型。

金融領域方面,數發部指出,有團隊運用語料發展具台灣在地金融語境的領域型大型語言模型,應用於法規查詢、監理規範理解、風險提示及金融情境推理等,希望能支援金融監理需求,提升金融服務與風險控管能力。

數發部表示,將持續推動政府機關盤點釋出語料,並擴大民間參與,建立可擴充、合法授權且能被實際應用的台灣語料生態,豐富具台灣特色與多元觀點的高品質語料。

數發部 主權 訓練

延伸閱讀

AI書狀打官司 專家提醒慎防AI幻覺

培育人才AI能力 TAICA頒首批學程學分證明

AI聯盟首批頒證 26人取得學程證書 逾6成非AI本科生

正確使用AI 司法機關推模型指引規範

相關新聞

輝達投資機器人將上市!能率亞洲押中Agility還要再買2家AI新創

能率亞洲(7777)2025年投資美國機器人新創Agility,今年第4季將在美國以SPAC模式掛牌上市,成第一家美國人型機器人概念股;由於對AI及機器人投資見解相似,能率亞洲與輝達已建立戰略投資夥伴關係,互相介紹案源,能率今年底也將評估NVIDIA引薦的北美機器人手臂及北美AI大腦新創投資案。

QR Code騙取個資增加 資安署示警3方式辨真偽

資安署近期示警,有駭客竄改研討會官方報名QR Code,騙取民眾個資。資安署表示,駭客多以覆蓋或更改數位海報偽冒,民眾掃...

輝達雙引擎發動!新一代產品價格翻倍 廣達、緯穎等業績將起飛

輝達(NVIDIA)最新人工智慧(AI)機櫃Vera Rubin量產,加上AI推論機櫃Groq 3 LPX同步推出,雙引擎帶動,加上新一代機櫃價格較前一代翻倍成長,AI供應鏈業績跟著起飛。

ODM 搶生意 擴大資本支出

輝達Vera Rubin機櫃主要客戶是美國雲端服務供應商(CSP)或新興雲端服務供應商,主要部署地點在美國,鴻海、廣達、緯創與緯穎等ODM廠今年持續擴大資本支出,除用來增加美國產能,由於高漲零組件價格推升營運成本,也為備料資金做好準備。

下半年輝達伺服器大量出貨 鴻海、技嘉、緯創大啖商機

輝達(NVIDIA)上周釋出亮眼的財報佳績與前景展望,激勵股價跳空大漲、並連動相關台系供應鏈強揚表態。法人建議,預期鴻海、技嘉、緯創等下游硬體組裝廠,將有機會受惠下半年輝達伺服器的大量出貨。

純晶圓代工 台積電連連稱霸!連續兩季拿下73%市占率

最新報告指出,受到人工智慧(AI)晶片需求大幅增加的帶動,全球只生產晶片,且不設計也不銷售自家產品的純晶圓代工市場,今年第2季較2025年同期大幅成長29%。台積電市占穩居全球第一。

udn討論區

0 則留言
規範
  • 張貼文章或下標籤,不得有違法或侵害他人權益之言論,違者應自負法律責任。
  • 對於明知不實或過度情緒謾罵之言論,經網友檢舉或本網站發現,聯合新聞網有權逕予刪除文章、停權或解除會員資格。不同意上述規範者,請勿張貼文章。
  • 對於無意義、與本文無關、明知不實、謾罵之標籤,聯合新聞網有權逕予刪除標籤、停權或解除會員資格。不同意上述規範者,請勿下標籤。
  • 凡「暱稱」涉及謾罵、髒話穢言、侵害他人權利,聯合新聞網有權逕予刪除發言文章、停權或解除會員資格。不同意上述規範者,請勿張貼文章。