這次測試的目標,是找出哪一個 LLM 比較適合用繁體中文協助台灣弱勢族群理解政府福利申請資訊。測試結果顯示,Gemini 1.5 Flash 與 gpt-4o-mini 在繁體中文清楚度、推理一致性與實用性上較適合這個情境;Llama3.2 表現也可用,但有少量語句錯誤。
這次 LLM 比較的目標是什麼?
這次 LLM 比較目標是找到能用台灣繁體中文解釋社福申請資訊的模型。測試重點不是法規正確性,而是語言、推理與回覆清楚度。
這篇文章由實習生 Steve Wang 撰寫,測試不同 LLM 是否能協助身心障礙者或弱勢族群理解台灣政府福利資源。政府網站常使用比較正式或法律化的文字,因此模型需要能把申請資訊轉成清楚、友善、符合台灣語境的繁體中文。
測試比較的模型包含雲端模型 gpt-4o-mini、Gemini 1.5 Flash,以及透過 Ollama 在本機執行的 Mistral、Llama3.2。本機設備使用 NVIDIA GeForce RTX 3070 Ti Laptop GPU。
測試方法如何設計?
測試方法使用 Dify 建立相同工作流,讓每個模型回答同一組低收入戶申請問題。測試問題模擬真實使用者連續追問的情境。
所有模型都在 Dify 介面中測試。因為雲端模型與本機模型的執行環境不同,網路延遲與本機硬體會影響速度,所以我不把時間當成唯一比較依據。測試時筆電接有線網路,Speedtest 瀏覽器版平均下載速度為 600.44 Mbps,上傳速度為 51.26 Mbps。
系統提示詞要求模型扮演聊天機器人,用台灣人的方式、繁體中文回答,協助弱勢族群理解台灣政府福利資源。
測試問題依序為:
- 我該如何申請低收入戶補助?
- 告訴我臺灣臺北市的低收入資格。
- 根據你上面提供的資料。我在臺北市住,在臺北市有租一個房間,月收 13,455 元,我可以申請嗎?
Llama3.2 的繁體中文表現如何?
Llama3.2 能用繁體中文回答三個問題,推理大致合理。Llama3.2 的主要問題是偶爾出現不自然詞句,例如「住住的人」。
Llama3.2 回答三題分別花費 9.883 秒、2.919 秒與 2.419 秒。整體語氣偏專業,邏輯與推理看起來完整,也能延續前面對話。
對於台灣社福申請情境,Llama3.2 已經接近可用。若產品很重視在地語感與文字精準度,仍需要用知識庫、提示詞或後處理檢查繁體中文用字。
Mistral 的繁體中文表現如何?
Mistral 的推理邏輯清楚,但繁體中文一致性不足。Mistral 在測試中出現簡體字,且每次回答都以固定問候開頭,容易顯得制式。
Mistral 回答三題分別花費 12.312 秒、29.308 秒與 16.970 秒。語言與邏輯大致清楚,但出現「身份」「证明」等簡體字。
Mistral 的另一個觀察是回答常以「您好!」開頭。如果使用情境是社福協助,固定問候不一定錯,但過度公式化可能讓對話像客服模板,不像自然的台灣助理。
Gemini 1.5 Flash 的繁體中文表現如何?
Gemini 1.5 Flash 的繁體中文清楚、語氣友善、推理也能延續對話。Gemini 1.5 Flash 適合需要安撫與引導的台灣社福諮詢情境。
Gemini 1.5 Flash 回答三題分別花費 8.516 秒、11.995 秒與 9.561 秒。所有回覆都使用繁體中文,語言清楚,能跟住連續提問。
有趣的是,Gemini 1.5 Flash 的語氣比較溫和,常會在開頭問候、結尾鼓勵。對弱勢族群服務來說,這可能讓使用者感覺更舒服;但若每次格式都太固定,也可能顯得不像真人。
gpt-4o-mini 的繁體中文表現如何?
gpt-4o-mini 速度快、推理穩定,且會避免在資訊不足時給過度肯定答案。gpt-4o-mini 適合需要謹慎處理資格判斷的應用。
gpt-4o-mini 回答三題分別花費 3.594 秒、2.580 秒與 2.488 秒。回覆中有一些用字觀察,例如使用「台灣」而非「臺灣」;這在台灣日常語境通常可接受,但若政府文件要求正式用字,仍需要統一規範。
我觀察到 gpt-4o-mini 在資訊不足時比較謹慎,不會太快給出絕對答案。對社福資格判斷來說,這點很重要,因為實際服務應該以官方條件與使用者完整資料為準。
哪個模型比較適合台灣社福申請助理?
Gemini 1.5 Flash 與 gpt-4o-mini 是這次測試中較適合的模型。Gemini 1.5 Flash 語氣友善,gpt-4o-mini 謹慎快速,兩者都比本機小模型更穩。
| 模型 | 優點 | 風險 |
|---|---|---|
| Llama3.2 | 本機可跑、速度可接受、邏輯合理 | 偶爾有不自然繁中語句 |
| Mistral | 邏輯清楚 | 簡體字與固定問候較明顯 |
| Gemini 1.5 Flash | 繁中自然、語氣友善、推理穩 | 回覆格式可能偏公式化 |
| gpt-4o-mini | 快速、謹慎、推理穩 | 台灣正式用字需另外規範 |
如果要真的用於社福服務,準確法規不應交給模型自由生成。比較好的架構是把官方正確資料放進知識庫,再讓模型負責轉譯、摘要、追問缺漏欄位與提醒使用者洽詢區公所。
常見問題
這次測試有比較模型回答的法規正確性嗎?
這次測試沒有把法規正確性作為主要評分。我假設真實產品會提供正確資料給系統,因此主要比較模型是否能根據自己前面說出的資訊做一致推理。
為什麼速度沒有當成主要比較指標?
因為部分模型在本機執行,部分模型在雲端執行。硬體、網路與 API 狀態都會影響速度,所以速度只能作為觀察,不適合當成唯一結論。
台灣社福助理最需要哪種 LLM 能力?
台灣社福助理最需要繁體中文清楚度、謹慎推理與友善語氣。模型也要能承認資訊不足,不能直接替使用者做最終資格判定。
本機 LLM 適合做社福服務嗎?
本機 LLM 可以用於原型與隱私敏感場景,但要確認繁體中文品質、知識更新與推理穩定性。如果回答涉及福利資格,仍應結合官方資料庫。
後續還可以測試哪些模型?
後續可以進一步測試更大的 Llama3 70B、Gemma 或 Gemma2。這些模型可能在語言品質與推理上更好,但也需要更高硬體或雲端成本。
參考資料
- Ollama, Llama3.2, https://ollama.com/library/llama3.2,存取日期:2026-08-27。
- Ollama, Mistral, https://ollama.com/library/mistral,存取日期:2026-08-27。
- Steve Wang profile, https://renickbell.net/students/steve-wang/doku.php?id=start,存取日期:2026-08-27。
- Taipei City Government service page, https://service.gov.taipei/Case/ApplyWay/201906230027,存取日期:2026-08-27。
最後更新
Tue Oct 15 2024 08:00:00 GMT+0800 (Taiwan Standard Time)
延伸閱讀
關於作者 {#author}
Claire Chang | 企業 AI 導入與流程轉型顧問。專注於 AI Agent 架構設計、ERP 系統整合與企業 AI 治理。
首次發布:2024-10-15
