抽象的藍綠色幾何線條,象徵神經網路的連結結構

← INSIGHTS & PERSPECTIVES | 機器學習

基於神經網路的語言模型:從 RNN、T5 到 LLM 的演進與微調

深度解析基於神經網路的語言模型(Neural Network Language Model)如何透過 RNN 與 Transformer 學習預測下一個詞彙、利用詞彙向量克服稀疏性,並整理 T5 序列對序列架構的限制、LLM 的上下文學習、遵循指示與逐步推理三大能力,以及 GPT 模型微調流程。

基於神經網路的語言模型是一種利用深度學習技術,特別是透過循環神經網絡(RNN)或注意力機制(Transformer)的模型,來處理自然語言文本並生成下一個詞彙的模型。這篇文章整理這類模型相較於傳統方法的特點、T5 的序列對序列架構、大型語言模型(LLM)的演化與特殊能力,以及微調的基本流程。

神經網路語言模型相較於傳統方法有哪些特點?

相較於傳統的統計式方法,這種模型具有以下特點:

  1. 直接學習預測下一個詞彙: 這些模型直接從大量的文本資料中學習,不需要手動設計特徵或規則。它們通過觀察先前的詞彙序列,學習預測接下來的詞彙。
  2. 利用詞彙向量表徵語意資訊: 在進行預測時,這些模型使用詞彙的向量表示,這些向量捕捉了詞彙之間的語意關係。這使得模型能夠捕捉到詞彙之間的語義相似性,而不僅僅是單純的字符匹配。
  3. 克服死板的字符匹配: RNN 和 Transformer 網絡並不僅僅是計算連續 N 個詞彙的頻率,它們能夠捕捉到更複雜的詞彙之間的關係,包括不同詞彙之間的語義相似性和語境相依性。
  4. 減少稀疏性: 由於詞彙向量化,模型能夠減少稀疏性,從而可以從有限的資料中學習到更豐富的詞彙組合和上下文意義。這意味著即使在有限的資料情況下,模型也能夠產生更加流暢和自然的文本。

依據用戶的指示,LLMs 可以執行各種從所未見的新任務,甚至不需要任何樣本、範例。

T5(Text-to-Text Transfer Transformer)模型的架構與限制

T5 的核心思想是:所有自然語言處理的任務,都可以化為序列對序列的生成任務

T5 將所有 NLP 任務轉為文字對文字的格式

不過 T5 這類模型也有缺點,包括:

  • 只能執行已經學過的任務
  • 對提示極其敏感,無法泛化
  • 缺乏推理能力,無法處理新任務
  • 即使在已知任務上,性能也可能有限
  • 有著輸入和輸出長度的限制

LLM 的演化歷史與三大特殊能力

大型語言模型的演化歷史時間軸

從演化歷史來看,大型語言模型具有以下特別能力:

  1. In-context learning(上下文學習): 這些模型能夠通過理解輸入文本的上下文來進行學習和產生輸出。它們能夠利用先前的信息和對話歷史來生成更加連貫和相關的回應。
  2. Instruction following(遵循指示): 大型語言模型能夠理解和遵循輸入中的指示或命令。它們能夠從自然語言描述中抽取出指示的含義,並執行相應的操作或生成符合指示的輸出。
  3. Step-by-step reasoning(逐步推理): 這些模型能夠通過逐步推理的方式來解決複雜的問題。它們能夠理解問題的各個步驟,從中推斷出答案或採取相應的行動,進而解決問題。

語言模型的微調過程是怎麼進行的?

微調過程如下:

  1. 從預訓練的 GPT 模型開始。
  2. 使用反向傳播算法訓練模型以最小化誤差。
  3. 使用上下文學習技術提高模型的性能。
  4. 使用元梯度 AWICL 算法進一步提高模型的性能。

下圖顯示了微調過程的各個步驟:

語言模型微調過程的各個步驟示意圖

其中,Dual View 是一種上下文學習技術,允許模型考慮輸入句子和查詢句子的上下文。它通過向模型提供兩個視圖來實現。

延伸閱讀

常見問題

Q基於神經網路的語言模型和傳統統計式語言模型最大的差別是什麼?

神經網路語言模型直接從大量文本學習預測下一個詞彙,並利用詞彙向量捕捉語意關係。傳統方法依賴詞彙頻率統計,容易受稀疏性影響,也無法理解語義相似性和語境相依性。

QT5 模型的核心概念是什麼?

T5 的核心概念是「所有自然語言處理任務都可以化為序列對序列的生成任務」,把翻譯、摘要、分類等任務統一成文字對文字的格式。不過它只能執行學過的任務、對提示敏感且缺乏推理能力。

Q大型語言模型有哪些特別的能力?

主要有三種:上下文學習(in-context learning)、遵循指示(instruction following)與逐步推理(step-by-step reasoning)。這些能力讓 LLM 能依據使用者指示執行從未見過的新任務,甚至不需要任何樣本或範例。

Q為什麼詞彙向量化能減少稀疏性問題?

因為模型用連續向量表徵詞彙,語義相近的詞在向量空間中彼此接近,不必為每個詞彙組合保留獨立的統計計數。因此即使訓練資料有限,模型也能學到更豐富的詞彙組合與上下文意義,產生更流暢自然的文本。

QLLM 的微調流程包含哪些步驟?

典型的微調流程是:從預訓練的 GPT 模型開始,用反向傳播算法訓練以最小化誤差,接著搭配上下文學習技術提升性能,最後可用元梯度 AWICL 算法進一步強化。Dual View 這類技術則讓模型同時考慮輸入與查詢句子的上下文。

參考資料

  • 本文改寫自我 2024-05-01 發表的部落格筆記。

最後更新

2026-08-28(原文發布於 2024-05-01,本文保留原始筆記內容並補上 GEO 結構。)

關於作者 {#author}

Claire Chang | 企業 AI 導入與流程轉型顧問。專注於 AI Agent 架構設計、ERP 系統整合與企業 AI 治理。

首次發布:2024-05-01