COSCUP x UbuCon Asia 2026 標誌
  • 關於我們
  • 議程
  • 交通
  • 會場地圖
  • 社群
  • 贊助夥伴
    • 參與指南
    • 第一次參與
    • 活動參與
    • 講者參與
    • 前夜派對
    • 海外參與者
    • 開源社群、攤位及議程軌
    • 贊助夥伴
    • 邀請函申請指南
  • 工作人員
  • 周邊活動 / BoF
  • 部落格
  • 社群守則
English

Benign Outliers 對 Twinkle AI 模型安全對齊之影響研究

時間
2026-08-09 11:10 ~ 11:40
講者
Allen, 黃亮勳
位置
TR212
共筆
Twinkle AI 中階中文

議程簡介

你以為「乾淨」的微調資料就是安全的嗎?最新研究指出,僅僅 100 筆來自 Dolly、Alpaca 這類良性資料集的樣本——表面無害、卻帶有有害梯度方向的 Benign Outliers——就足以讓一個對齊過的 LLM 安全防線全面崩潰,而且完全不需要外部惡意資料當錨點。 本場分享將以 Twinkle AI 開源的 gemma-3-4B-T1-it 為實驗對象,帶大家走過一次真實的攻擊與防禦:如何用 Self-Inf-N 從繁中良性資料中挖出這些「隱形地雷」、它們在連續學習場景下有多難消除,以及 SafeGrad、AsFT 這類梯度約束防禦方法到底擋不擋得住。 適合對 LLM 安全、微調、開源模型治理有興趣的開發者與研究者。

講者

Allen

Allen

我目前是台灣科技大學資訊工程所碩士二年級學生,具備生成式 AI、深度學習與 DevOps 的實務經驗。碩士研究聚焦於 LLM 微調的資安議題。專案經驗橫跨大型語言模型等 AI 領域,曾協助跨國企業提出 AI PoC,也參與過 RAG 解決方案的設計。歡迎大家與我交流!

黃亮勳

黃亮勳

創辦 Twinkle AI,專注於開源繁體中文資料集與下一代繁中模型,為台灣 AI 生態奠定基礎並持續推進模型訓練技術。領導團隊打造台灣首個最小推理模型 Formosa-1 (F1),並曾以一人團隊完成繁體中文語料蒐集與模型訓練,成功推出台灣首個 Llama 3.2 3B 最小推理模型。

鑽石級

Canonical

黃金級

連續贊助2 年中華民國資訊經理人協會連續贊助2 年國泰金融控股公司連續贊助5 年玉山銀行累計贊助12 年MySQL累計贊助6 年華捷智能股份有限公司Nitra

白銀級

累計贊助16 年慧邦科技股份有限公司  Gamesofa Inc.

青銅級

華娛網路娛樂股份有限公司財團法人國家實驗研究院國家高速網路與計算中心ONLYOFFICEQNAP Systems, Inc. 威聯通科技連續贊助16 年祐生研究基金會源鋼技術顧問有限公司 SUN SQUARE Co., Ltd

好朋友級

連續贊助3 年晶心科技股份有限公司沛星互動科技股份有限公司

特別感謝

連續贊助2 年臺北市政府資訊局美商賽發馥股份有限公司臺灣分公司Rozeta AI

共同主辦單位

累計合作9 年臺灣科技大學 電子工程系

協辦單位

累計合作12 年開放文化基金會

COSCUP x UbuCon Asia 2026

Conference for Open Source Coders, Users, and Promoters | 亞洲最大開源年會,由社群自發舉辦。

聯絡我們

  • 會眾服務
  • 贊助合作
  • 議程投稿
  • 行銷方案

相關資源

  • COSCUP 部落格
  • 訂閱電子報
  • 活動照片

網站導覽

  • 首頁
  • 關於我們
  • 交通資訊
  • 贊助夥伴
20062007200820092010201120122013201420152016201720182019202020212022202320242025