530 多篇既有文章透過 AI Agent 分批改寫,並以 Mapping 表追蹤進度與品質

← INSIGHTS & PERSPECTIVES | 生成式AI

530 篇舊文章如何用 AI Agent 重整?兩天實作、成本與驗收流程

記錄我如何把 530 多篇舊文章拆成 AI Agent 可重複執行的批次流程,兩天內完成改寫,並比較 ChatGPT、Claude、Gemini、DeepSeek、GLM 的批次表現、成本與驗收方法。

我原本只是想替網站上的舊文章補充結構、來源與近期資料,真正開始處理後才發現,最耗時間的不是寫某一篇文章,而是 530 多次重複動作:開啟檔案、讀取內容、依規格修改、更新欄位、搬移圖片、改檔名、記錄狀態,再檢查有沒有漏掉。

我最後把這些動作整理成 AI Agent 可以反覆執行的流程,兩天內完成 530 多篇文章。這兩天還包含測試模型、修改 Prompt、處理失敗結果,以及我原本的工作與生活;有一次我啟動約 100 篇的任務後去上健身課,回來時整批已經完成。

AI Agent 取代了哪些重複動作?

AI Agent 最適合取代規則明確、需要重複執行,而且結果可以檢查的動作。這次它負責逐篇讀取、整理格式、補齊欄位、更新圖片與記錄進度,我則保留內容判斷、例外處理與最後驗收。

這次每篇文章大致需要完成:

  • 保留原有技術細節、觀點與有效超連結。
  • 更新標題、description、front matter 與標題階層。
  • 補充直接回答、可靠來源與必要的 FAQ。
  • 搬移圖片、更新網址,並改成具有意義的圖片檔名。
  • 登記原始檔名、輸出檔名、完成狀態與異常原因。
  • 檢查是否漏件、失真或殘留不該出現的文字。

我使用 DeepSeek、GLM 這類開放權重或低成本模型時,不是直接把一段 Prompt 丟給模型,而是透過 Hermes Agent 串接。Hermes Agent 提供工具操作、持續記憶與 Sub-agent 分工,讓模型能讀寫檔案、分批執行並反覆檢查;缺少這層 Agent 能力,單用模型處理完整工作流程會弱很多。

如果每篇人工處理 30 分鐘,530 篇需要 265 小時,約等於 33 個八小時工作天。AI Agent 的價值,是讓我不用親手重複 530 次相同步驟。

不同模型批次執行的差異有多大?

單篇文章寫得好,不代表模型能穩定完成大量批次。這次 ChatGPT 與 Claude 最能保留既有內容;Gemini、DeepSeek 與 GLM 則各有固定失敗模式,需要用流程發現與補救。

以下是我在不同工具、批次與代理設定下的實際觀察,不是控制所有變因的模型評測:

模型這次批次處理的表現
ChatGPT、Claude即使我的需求很模糊,也會主動補齊工作細節;能保留技術內容與觀點,同時讓文字更順,一次約 10 篇仍會逐篇處理
Gemini透過 Anti-Gravity 執行時,常省略大量內容、把文章縮得過短;可能同時受到模型、代理調度與批量影響
DeepSeek少量測試尚可,大量處理時常寫出「原文提到」,而且省略既有內容的情況較嚴重,因此無法接受
GLM也會殘留少量「原文」字樣,但通常能保留必要內容;較常漏掉 FAQ、參考資料、圖片搬移、網址更新或圖片檔名

ChatGPT 與 Claude 的能力仍然明顯比較強。我只提供相對模糊的需求,它們就能主動想到許多我沒有逐項說明的細節,並完成品質很好的文章;GLM 若只收到同樣模糊的要求,完整度還是有差距。

GLM 後來進步的關鍵,是 ChatGPT 在執行時留下了一套完整的工作方法與處理步驟。我把這份方法整理後交給 GLM,讓它不必自行猜測每一步應該怎麼做。GLM 仍會殘留少量「原文」,但通常不會像 DeepSeek 一樣連必要內容都省略,因此比較容易用後續掃描修正。

我再用 ChatGPT 與 Claude 交叉檢查常見問題,並花不少時間人工抽查。最後成品普遍可用,但這代表「高階模型設計方法+低成本模型執行+跨模型檢查+人工抽查」有效,不代表 GLM 本身已經和 ChatGPT 一樣強。

我如何把 530 篇文章變成可管理的批次?

大量任務不能只靠一段很長的 Prompt,而要拆成規格、測試、批次、狀態追蹤與驗收。AI Agent 可以負責執行,人必須先定義完成條件及失敗後怎麼處理。

我的流程分成六步:

  1. 定義完成標準: 明確列出必填欄位、內容結構、保留項目與禁止事項。
  2. 測試代表文章: 先確認模型會不會刪除細節、改變原意、破壞連結或捏造資料。
  3. 拆分批次: 先跑 10 篇,穩定後再擴大,避免單次失敗影響全部文章。
  4. 更新 Mapping 表: 逐篇記錄輸入、輸出、狀態、檢查結果與異常原因。
  5. 檢查完整性: 確認檔案數、必要欄位、來源、FAQ、圖片與禁止殘留文字。
  6. 檢查內容: 比對技術資訊、第一手經驗、作者原意及新增資料的可靠性。

沒有 Mapping 表,即使 AI 漏掉三篇,整批看起來仍可能像已完成。有了逐篇狀態,才能知道少了哪篇、錯在哪裡,以及要重跑哪個步驟。

AI Agent 自動執行,為什麼仍要驗收?

AI Agent 能自動執行,不代表可以無人負責。批次越大,越容易出現少數漏件、缺欄位或內容失真,真正可靠的自動化必須讓錯誤可以被發現、定位與重跑。

這次讓我最有感的,不是哪個模型最聰明,而是模型會用不同方式「看起來完成」:

  • Gemini 可能交出完整檔案,內容卻被大幅縮短。
  • DeepSeek 可能遵守格式,正文卻一直評論「原文」。
  • GLM 可能把主文寫好,最後漏掉 FAQ、來源或圖片,也可能宣稱已移除所有「原文」字樣,實際檔案仍有殘留。

只檢查檔案是否存在,或直接相信 Agent 回報「已全部比對」,這些問題都可能被當成成功。我讓 GLM 掃描多輪,再用 ChatGPT、Claude 交叉檢查,最後由我人工抽查;Agent 的完成聲明只能當成一筆狀態,不能取代實際驗收。

這套 AI Agent 流程花了多少錢?

我的兩批 API 實測中,GPT-5.6 Sol 平均每篇約 1 美元;GLM-5.3 Flash 執行三輪後平均每篇約 0.0526 美元,約為前者的 1/19。這是兩批真實支出,不是控制文章長度、Token 與人工時間後的模型基準測試。

ChatGPT 那批的體驗其實非常好。我只用模糊的方式描述需求,去上健身課回來後,約 100 篇文章已經全部完成,而且品質比我預期更好。接著看到 API 支出約 100 美元時,我真的嚇了一跳,也因此開始研究:能不能先用高階模型建立方法,再讓價格較低的模型完成剩餘文章?

實測項目GPT-5.6 SolGLM-5.3 Flash
文章數100 篇76 篇
API 支出約 100 美元約 4 美元
平均每篇約 1 美元約 0.0526 美元

當時 OpenRouter 顯示,GPT-5.6 Sol 每百萬輸入/輸出 Token 為 2/10 美元;GLM-5.3 Flash 促銷價為 0.075/0.25 美元。成本降低很大一部分來自模型牌價,流程的價值則是讓低成本模型在驗收保護下承接工作。GPT-5.6 Sol 定價GLM-5.3 Flash 定價

1/19 只適用於這次兩批任務,沒有包含訂閱月費、Prompt 設計、跨模型檢查與我投入的大量人工抽查時間。GLM 的 API 成本很低,但不能因此解讀為整體專案幾乎不需要人力。

哪些工作適合交給 AI Agent?

適合交給 AI Agent 的工作,通常具備三個條件:需要大量重複、規則能夠寫清楚、結果可以驗收。涉及高風險判斷、模糊目標或責任歸屬的工作,仍應由人主導。

文章重整只是其中一個案例。相同方法也能應用在資料分類、表格整理、報告格式化、文件搬移、欄位補齊與初步檢查。

判斷一項工作能不能交給 AI Agent,可以先問:

  1. 能不能清楚寫出輸入、步驟與完成條件?
  2. 錯誤能不能被程式或清單發現?
  3. 失敗後能不能只重跑受影響的部分?
  4. 哪些例外必須交回人工判斷?

如果只能告訴 AI「幫我做好」,卻無法說明什麼叫完成,就還不適合直接大規模自動化。

AI Agent 批次工作常見問題

AI Agent 批次工作的核心,不是一次處理越多越好,而是每一項任務都有狀態、錯誤能被定位、失敗可以重跑。先用小批次驗證,再逐步放大,比直接追求全自動更可靠。

Q一次可以讓 AI Agent 處理多少篇?

沒有固定答案,會受到文章長度、模型、平台限制與代理調度方式影響。我曾一次處理數十篇,也曾在健身課期間完成約 100 篇;實務上仍建議先從 10 篇開始測試。

QPrompt 寫得夠完整,就不需要檢查嗎?

不行。DeepSeek 即使收到禁止提及「原文」的指令,仍可能重複出現;GLM 也可能在主文完成後漏掉 FAQ 或圖片。Prompt 是規格的一部分,驗收與重跑機制同樣重要。

Q為什麼開放權重模型需要搭配 Agent?

模型本身主要負責理解與生成;Hermes Agent 則提供讀寫檔案、呼叫工具、分配 Sub-agent、保存工作方法與持續執行的能力。這次成果來自「模型+Hermes Agent+明確方法+多輪驗收」,不能理解成單用 GLM 或 DeepSeek 就能直接完成 530 篇文章。

參考資料

本文的模型價格來自 OpenRouter 公開資料;530 多篇文章的模型表現、Mapping 流程、三輪驗收與實際支出,來自我的第一手專案紀錄。

延伸閱讀

關於作者

Claire Chang | 企業 AI 導入與流程轉型顧問。專注於 AI Agent 架構設計、ERP 系統整合與企業 AI 治理。

首次發布:2026-08-28