基於神經網路的語言模型是一種利用深度學習技術,特別是透過循環神經網絡(RNN)或注意力機制(Transformer)的模型,來處理自然語言文本並生成下一個詞彙的模型。這篇文章整理這類模型相較於傳統方法的特點、T5 的序列對序列架構、大型語言模型(LLM)的演化與特殊能力,以及微調的基本流程。
神經網路語言模型相較於傳統方法有哪些特點?
相較於傳統的統計式方法,這種模型具有以下特點:
- 直接學習預測下一個詞彙: 這些模型直接從大量的文本資料中學習,不需要手動設計特徵或規則。它們通過觀察先前的詞彙序列,學習預測接下來的詞彙。
- 利用詞彙向量表徵語意資訊: 在進行預測時,這些模型使用詞彙的向量表示,這些向量捕捉了詞彙之間的語意關係。這使得模型能夠捕捉到詞彙之間的語義相似性,而不僅僅是單純的字符匹配。
- 克服死板的字符匹配: RNN 和 Transformer 網絡並不僅僅是計算連續 N 個詞彙的頻率,它們能夠捕捉到更複雜的詞彙之間的關係,包括不同詞彙之間的語義相似性和語境相依性。
- 減少稀疏性: 由於詞彙向量化,模型能夠減少稀疏性,從而可以從有限的資料中學習到更豐富的詞彙組合和上下文意義。這意味著即使在有限的資料情況下,模型也能夠產生更加流暢和自然的文本。
依據用戶的指示,LLMs 可以執行各種從所未見的新任務,甚至不需要任何樣本、範例。
T5(Text-to-Text Transfer Transformer)模型的架構與限制
T5 的核心思想是:所有自然語言處理的任務,都可以化為序列對序列的生成任務。

不過 T5 這類模型也有缺點,包括:
- 只能執行已經學過的任務
- 對提示極其敏感,無法泛化
- 缺乏推理能力,無法處理新任務
- 即使在已知任務上,性能也可能有限
- 有著輸入和輸出長度的限制
LLM 的演化歷史與三大特殊能力

從演化歷史來看,大型語言模型具有以下特別能力:
- In-context learning(上下文學習): 這些模型能夠通過理解輸入文本的上下文來進行學習和產生輸出。它們能夠利用先前的信息和對話歷史來生成更加連貫和相關的回應。
- Instruction following(遵循指示): 大型語言模型能夠理解和遵循輸入中的指示或命令。它們能夠從自然語言描述中抽取出指示的含義,並執行相應的操作或生成符合指示的輸出。
- Step-by-step reasoning(逐步推理): 這些模型能夠通過逐步推理的方式來解決複雜的問題。它們能夠理解問題的各個步驟,從中推斷出答案或採取相應的行動,進而解決問題。
語言模型的微調過程是怎麼進行的?
微調過程如下:
- 從預訓練的 GPT 模型開始。
- 使用反向傳播算法訓練模型以最小化誤差。
- 使用上下文學習技術提高模型的性能。
- 使用元梯度 AWICL 算法進一步提高模型的性能。
下圖顯示了微調過程的各個步驟:

其中,Dual View 是一種上下文學習技術,允許模型考慮輸入句子和查詢句子的上下文。它通過向模型提供兩個視圖來實現。
延伸閱讀
常見問題
基於神經網路的語言模型和傳統統計式語言模型最大的差別是什麼?
神經網路語言模型直接從大量文本學習預測下一個詞彙,並利用詞彙向量捕捉語意關係。傳統方法依賴詞彙頻率統計,容易受稀疏性影響,也無法理解語義相似性和語境相依性。
T5 模型的核心概念是什麼?
T5 的核心概念是「所有自然語言處理任務都可以化為序列對序列的生成任務」,把翻譯、摘要、分類等任務統一成文字對文字的格式。不過它只能執行學過的任務、對提示敏感且缺乏推理能力。
大型語言模型有哪些特別的能力?
主要有三種:上下文學習(in-context learning)、遵循指示(instruction following)與逐步推理(step-by-step reasoning)。這些能力讓 LLM 能依據使用者指示執行從未見過的新任務,甚至不需要任何樣本或範例。
為什麼詞彙向量化能減少稀疏性問題?
因為模型用連續向量表徵詞彙,語義相近的詞在向量空間中彼此接近,不必為每個詞彙組合保留獨立的統計計數。因此即使訓練資料有限,模型也能學到更豐富的詞彙組合與上下文意義,產生更流暢自然的文本。
LLM 的微調流程包含哪些步驟?
典型的微調流程是:從預訓練的 GPT 模型開始,用反向傳播算法訓練以最小化誤差,接著搭配上下文學習技術提升性能,最後可用元梯度 AWICL 算法進一步強化。Dual View 這類技術則讓模型同時考慮輸入與查詢句子的上下文。
參考資料
- 本文改寫自我 2024-05-01 發表的部落格筆記。
最後更新
2026-08-28(原文發布於 2024-05-01,本文保留原始筆記內容並補上 GEO 結構。)
關於作者 {#author}
Claire Chang | 企業 AI 導入與流程轉型顧問。專注於 AI Agent 架構設計、ERP 系統整合與企業 AI 治理。
首次發布:2024-05-01
