COSCUP x UbuCon Asia 2026 標誌
  • 關於我們
  • 議程
  • 交通
  • 會場地圖
  • 社群
  • 贊助夥伴
    • 參與指南
    • 第一次參與
    • 活動參與
    • 講者參與
    • 前夜派對
    • 海外參與者
    • 開源社群、攤位及議程軌
    • 贊助夥伴
    • 邀請函申請指南
  • 工作人員
  • 周邊活動 / BoF
  • 部落格
  • 社群守則
English

Twinkle Eval:打造繁體中文 LLM 開源評測工具

時間
2026-08-09 10:00 ~ 10:30
講者
黃亮勳
位置
TR212
共筆
Twinkle AI 入門中文

議程簡介

近年大型語言模型(LLM)快速發展,但「怎麼公平、快速、可重現地評估模型能力」仍是實務上的痛點。尤其對繁體中文場景而言,現有 benchmark 工具往往偏向英文生態,缺乏對本地資料集、模型部署方式,以及實際評測流程的友善支援。

這場分享將介紹我們打造的開源評測工具 Twinkle Eval,一套專為 LLM benchmark 設計的自動化評測框架,聚焦繁體中文模型評估需求。Twinkle Eval 支援多種資料格式、OpenAI API 與自架模型介接,提供平行批次評測、題目選項隨機化、多次重複測試穩定性分析,以及完整結果追蹤,讓模型評測不再只是「跑一次分數」,而是能更可靠地理解模型真實能力。

我們會分享設計這套工具的背景與工程取捨,包含為什麼現有工具不夠用、如何處理 benchmark contamination 與選擇題 positional bias、如何提升大規模評測效率,以及在繁體中文 benchmark(如 TMMLU+、法律資料集)上的實際使用經驗。

如果你正在訓練模型、比較不同 checkpoint、做模型選型,或只是想建立更可信的 LLM evaluation workflow,這場分享會帶你快速理解現代 LLM benchmark 的實務方法,以及我們在開源工具開發中的經驗與踩坑。

講者

黃亮勳

黃亮勳

創辦 Twinkle AI,專注於開源繁體中文資料集與下一代繁中模型,為台灣 AI 生態奠定基礎並持續推進模型訓練技術。領導團隊打造台灣首個最小推理模型 Formosa-1 (F1),並曾以一人團隊完成繁體中文語料蒐集與模型訓練,成功推出台灣首個 Llama 3.2 3B 最小推理模型。

鑽石級

Canonical

黃金級

連續贊助2 年中華民國資訊經理人協會連續贊助2 年國泰金融控股公司連續贊助5 年玉山銀行累計贊助12 年MySQL累計贊助6 年華捷智能股份有限公司Nitra

白銀級

累計贊助16 年慧邦科技股份有限公司  Gamesofa Inc.

青銅級

華娛網路娛樂股份有限公司財團法人國家實驗研究院國家高速網路與計算中心ONLYOFFICEQNAP Systems, Inc. 威聯通科技連續贊助16 年祐生研究基金會源鋼技術顧問有限公司 SUN SQUARE Co., Ltd

好朋友級

連續贊助3 年晶心科技股份有限公司沛星互動科技股份有限公司

特別感謝

連續贊助2 年臺北市政府資訊局美商賽發馥股份有限公司臺灣分公司Rozeta AI

共同主辦單位

累計合作9 年臺灣科技大學 電子工程系

協辦單位

累計合作12 年開放文化基金會

COSCUP x UbuCon Asia 2026

Conference for Open Source Coders, Users, and Promoters | 亞洲最大開源年會,由社群自發舉辦。

聯絡我們

  • 會眾服務
  • 贊助合作
  • 議程投稿
  • 行銷方案

相關資源

  • COSCUP 部落格
  • 訂閱電子報
  • 活動照片

網站導覽

  • 首頁
  • 關於我們
  • 交通資訊
  • 贊助夥伴
20062007200820092010201120122013201420152016201720182019202020212022202320242025