2019年前後,一位在大型雲端服務業者任職的朋友興奮地分享:他們訓練一個CNN模型處理單據文字辨識,效果不錯,但直接上線的運算成本太高,於是用「蒸餾」(distillation)訓練出一個較小的模型來提供服務,發現還挺有效的。
蒸餾一直是深度學習常用的策略之一,也稱為師生架構(teacher-student)。用一個能力好的大模型當「老師」,訓練另一個「學生」模型(不一定較小)。手上有沒有原始標註資料,各有對應的做法。早期做法在2015年前後成形,最直接的是讓學生去逼近老師的輸出,不需要標註。後來加上「軟目標」,或與原始標註資料一起用;也可以讓學生模仿網路中間層,不只看最後的輸出。
這套做法到今天仍在用,但搬的不只是模型大小,而是能力。我們近期的研究讓老師看密集的3D點雲、學生處理刻意稀疏化的點雲,把兩邊的中間特徵(理解能力)對起來,稀疏點雲限制下的3D辨識能力(機器人、自駕車)就被提升上來。
到了大型語言模型,蒸餾的角色又不一樣了。2025年初,一個開放權重的大型推論模型把自己的推論過程蒸餾進一系列小模型,有些的表現接近當時的閉源前沿模型。從那之後,能不能用前沿大模型訓練出成本可接受的小模型,就成為大家矚目的焦點。
語言模型的訓練,可以粗分成兩大階段。預訓練(pre-training)吃的是海量文字,學的是語言結構與世界知識,可以說是讓模型牙牙學語的階段。後訓練(post-training)教的是另一件事,模型怎麼遵循指令、把話說得專業,把複雜問題抽絲剝繭處理好(推論)。需要的訓練資料就是「一個專業的回答長什麼樣」,而前沿模型正好能生成這樣的資料。所以蒸餾用在後訓練特別直覺。
蒸餾怎麼做,開放權重的模型多半會披露在技術報告中。差別主要在老師給學生什麼訊號。最簡單的一種是把老師生成的文字當教材。設定一批問題讓老師(前沿模型)回答,收下來的問答就是訓練資料,只要拿得到API,蒸餾就能啟動。細一點的是讓學生逼近老師在每個字上的機率分布,這需要模型權重。Google的Gemma連預訓練都用蒸餾,後訓練再從大型的指令模型蒸餾一次。近期較受關注的on-policy蒸餾又更進一步,讓學生先用自己的方式作答、老師逐字批改。在數學競賽題上,用約10分之1的運算量就能達到強化學習的水準。
老師也不必只有一個或一定更大。已經有模型用上超過10個各自專精的領域老師,把不同專長蒸餾轉移進同一個學生。把公司資料訓進模型之後,原本的對話與指令能力常會退化,這時拿還沒微調過的原始版本當老師,有機會把退化的部分教回來。
但蒸餾並非總是有效:2026年的一項研究指出,老師與學生用同一批資料、量又足夠大時,增益相當有限,資料稀少的領域任務才是它發揮空間較大的地方。
前面談的是狹義的蒸餾,老師與學生都是模型。把範圍拉大,前沿模型也可以當成知識與資料的來源,協助標註甚至擔任代理人(Agent)。過去要建資料集,得找標註人力、寫規範、做品管,週期以月計。現在例行、量大的標註工作,部分前沿模型的輸出品質已經堪用,單位成本也低得多,需要專家判斷的領域當然還有難處。
一種做法是讓大模型直接提供監督訊號。如低光源影像增強傳統上需要成對的明暗影像當參考,訓練影像不易取得。我們近期的做法是改用視覺語言模型(VLM)對影像內容的理解當引導,就能在沒有參考影像的條件下訓練,下游的分類與物件偵測都因此受惠。
另一種是用大模型產生資料標註。我們建過一個電影理解的問答資料集,問的是角色動機與情節因果這類需要思考推論的問題,人工出題慢,也難維持一致品質。做法是讓多個語言模型扮演不同的思考代理人,各自提問、互相檢視與修正,再產出問答資料集。前沿模型直接擔任資料標註的Agent。
還有一種是把常識搬進訓練系統。長時序的機器人操作任務難在中間沒有回饋訊號,我們的做法是先用語言模型把任務拆成不同階段與所需動作,列出各階段應有的物體狀態,再讓視覺模型依這套結構判斷任務進度、建立獎勵訊號。這些過去要靠工程師逐條寫進系統的常識,現在能從前沿模型(自動)取得。
令人更期待的是,蒸餾有機會做出能力好的較小模型,把運算從雲端往外移。對企業來說,較小的模型在部分推論任務上已逼近前沿,有機會在數張GPU的地端伺服器部署。自建小模型也因此從構想變成可評估的選項:法務、財務、產業know-how這類資訊密集又不宜外傳的領域尤其明顯。訓練前沿模型的花費以數億美元計,但能力一旦以API或開放權重現身,讓小模型接近它的成本低了一到兩個數量級。
另一個方向是終端裝置:手機、機械手臂、檢測設備都可受惠於蒸餾。機器人的需求特別直接,它要在實體空間裡即時執行動作,許多控制環節沒有等待雲端往返的餘裕。高速產線的檢測設備也一樣,模型再準,跟不上產線節拍就用不上。
使用大模型生成或標註資料再訓練自己的模型,已經是研發的常態,前提是條款允許。前沿模型供應商的服務條款多半禁止拿模型輸出去訓練與他們競爭的模型,各家的界線並不一致。另一條路是改用可自行部署的開放權重模型,生成與訓練都在自己手上,也避開資料外流。早年蒸餾搬的是辨識模型的效率,現在搬的是語言、推論與常識。老師模型愈強,能搬的就愈多。