Twinkle Eval:打造繁體中文 LLM 開源評測工具
- Time
- 2026-08-09 10:00 ~ 10:30
- Speaker
- 黃亮勳
- Room
- TR212
- Co-write
Abstract
近年大型語言模型(LLM)快速發展,但「怎麼公平、快速、可重現地評估模型能力」仍是實務上的痛點。尤其對繁體中文場景而言,現有 benchmark 工具往往偏向英文生態,缺乏對本地資料集、模型部署方式,以及實際評測流程的友善支援。
這場分享將介紹我們打造的開源評測工具 Twinkle Eval,一套專為 LLM benchmark 設計的自動化評測框架,聚焦繁體中文模型評估需求。Twinkle Eval 支援多種資料格式、OpenAI API 與自架模型介接,提供平行批次評測、題目選項隨機化、多次重複測試穩定性分析,以及完整結果追蹤,讓模型評測不再只是「跑一次分數」,而是能更可靠地理解模型真實能力。
我們會分享設計這套工具的背景與工程取捨,包含為什麼現有工具不夠用、如何處理 benchmark contamination 與選擇題 positional bias、如何提升大規模評測效率,以及在繁體中文 benchmark(如 TMMLU+、法律資料集)上的實際使用經驗。
如果你正在訓練模型、比較不同 checkpoint、做模型選型,或只是想建立更可信的 LLM evaluation workflow,這場分享會帶你快速理解現代 LLM benchmark 的實務方法,以及我們在開源工具開發中的經驗與踩坑。
Speaker
黃亮勳
創辦 Twinkle AI,專注於開源繁體中文資料集與下一代繁中模型,為台灣 AI 生態奠定基礎並持續推進模型訓練技術。領導團隊打造台灣首個最小推理模型 Formosa-1 (F1),並曾以一人團隊完成繁體中文語料蒐集與模型訓練,成功推出台灣首個 Llama 3.2 3B 最小推理模型。