我原本只是想替網站上的舊文章補充結構、來源與近期資料,真正開始處理後才發現,最耗時間的不是寫某一篇文章,而是 530 多次重複動作:開啟檔案、讀取內容、依規格修改、更新欄位、搬移圖片、改檔名、記錄狀態,再檢查有沒有漏掉。
我最後把這些動作整理成 AI Agent 可以反覆執行的流程,兩天內完成 530 多篇文章。這兩天還包含測試模型、修改 Prompt、處理失敗結果,以及我原本的工作與生活;有一次我啟動約 100 篇的任務後去上健身課,回來時整批已經完成。
AI Agent 取代了哪些重複動作?
AI Agent 最適合取代規則明確、需要重複執行,而且結果可以檢查的動作。這次它負責逐篇讀取、整理格式、補齊欄位、更新圖片與記錄進度,我則保留內容判斷、例外處理與最後驗收。
這次每篇文章大致需要完成:
- 保留原有技術細節、觀點與有效超連結。
- 更新標題、description、front matter 與標題階層。
- 補充直接回答、可靠來源與必要的 FAQ。
- 搬移圖片、更新網址,並改成具有意義的圖片檔名。
- 登記原始檔名、輸出檔名、完成狀態與異常原因。
- 檢查是否漏件、失真或殘留不該出現的文字。
我使用 DeepSeek、GLM 這類開放權重或低成本模型時,不是直接把一段 Prompt 丟給模型,而是透過 Hermes Agent 串接。Hermes Agent 提供工具操作、持續記憶與 Sub-agent 分工,讓模型能讀寫檔案、分批執行並反覆檢查;缺少這層 Agent 能力,單用模型處理完整工作流程會弱很多。
如果每篇人工處理 30 分鐘,530 篇需要 265 小時,約等於 33 個八小時工作天。AI Agent 的價值,是讓我不用親手重複 530 次相同步驟。
不同模型批次執行的差異有多大?
單篇文章寫得好,不代表模型能穩定完成大量批次。這次 ChatGPT 與 Claude 最能保留既有內容;Gemini、DeepSeek 與 GLM 則各有固定失敗模式,需要用流程發現與補救。
以下是我在不同工具、批次與代理設定下的實際觀察,不是控制所有變因的模型評測:
| 模型 | 這次批次處理的表現 |
|---|---|
| ChatGPT、Claude | 即使我的需求很模糊,也會主動補齊工作細節;能保留技術內容與觀點,同時讓文字更順,一次約 10 篇仍會逐篇處理 |
| Gemini | 透過 Anti-Gravity 執行時,常省略大量內容、把文章縮得過短;可能同時受到模型、代理調度與批量影響 |
| DeepSeek | 少量測試尚可,大量處理時常寫出「原文提到」,而且省略既有內容的情況較嚴重,因此無法接受 |
| GLM | 也會殘留少量「原文」字樣,但通常能保留必要內容;較常漏掉 FAQ、參考資料、圖片搬移、網址更新或圖片檔名 |
ChatGPT 與 Claude 的能力仍然明顯比較強。我只提供相對模糊的需求,它們就能主動想到許多我沒有逐項說明的細節,並完成品質很好的文章;GLM 若只收到同樣模糊的要求,完整度還是有差距。
GLM 後來進步的關鍵,是 ChatGPT 在執行時留下了一套完整的工作方法與處理步驟。我把這份方法整理後交給 GLM,讓它不必自行猜測每一步應該怎麼做。GLM 仍會殘留少量「原文」,但通常不會像 DeepSeek 一樣連必要內容都省略,因此比較容易用後續掃描修正。
我再用 ChatGPT 與 Claude 交叉檢查常見問題,並花不少時間人工抽查。最後成品普遍可用,但這代表「高階模型設計方法+低成本模型執行+跨模型檢查+人工抽查」有效,不代表 GLM 本身已經和 ChatGPT 一樣強。
我如何把 530 篇文章變成可管理的批次?
大量任務不能只靠一段很長的 Prompt,而要拆成規格、測試、批次、狀態追蹤與驗收。AI Agent 可以負責執行,人必須先定義完成條件及失敗後怎麼處理。
我的流程分成六步:
- 定義完成標準: 明確列出必填欄位、內容結構、保留項目與禁止事項。
- 測試代表文章: 先確認模型會不會刪除細節、改變原意、破壞連結或捏造資料。
- 拆分批次: 先跑 10 篇,穩定後再擴大,避免單次失敗影響全部文章。
- 更新 Mapping 表: 逐篇記錄輸入、輸出、狀態、檢查結果與異常原因。
- 檢查完整性: 確認檔案數、必要欄位、來源、FAQ、圖片與禁止殘留文字。
- 檢查內容: 比對技術資訊、第一手經驗、作者原意及新增資料的可靠性。
沒有 Mapping 表,即使 AI 漏掉三篇,整批看起來仍可能像已完成。有了逐篇狀態,才能知道少了哪篇、錯在哪裡,以及要重跑哪個步驟。
AI Agent 自動執行,為什麼仍要驗收?
AI Agent 能自動執行,不代表可以無人負責。批次越大,越容易出現少數漏件、缺欄位或內容失真,真正可靠的自動化必須讓錯誤可以被發現、定位與重跑。
這次讓我最有感的,不是哪個模型最聰明,而是模型會用不同方式「看起來完成」:
- Gemini 可能交出完整檔案,內容卻被大幅縮短。
- DeepSeek 可能遵守格式,正文卻一直評論「原文」。
- GLM 可能把主文寫好,最後漏掉 FAQ、來源或圖片,也可能宣稱已移除所有「原文」字樣,實際檔案仍有殘留。
只檢查檔案是否存在,或直接相信 Agent 回報「已全部比對」,這些問題都可能被當成成功。我讓 GLM 掃描多輪,再用 ChatGPT、Claude 交叉檢查,最後由我人工抽查;Agent 的完成聲明只能當成一筆狀態,不能取代實際驗收。
這套 AI Agent 流程花了多少錢?
我的兩批 API 實測中,GPT-5.6 Sol 平均每篇約 1 美元;GLM-5.3 Flash 執行三輪後平均每篇約 0.0526 美元,約為前者的 1/19。這是兩批真實支出,不是控制文章長度、Token 與人工時間後的模型基準測試。
ChatGPT 那批的體驗其實非常好。我只用模糊的方式描述需求,去上健身課回來後,約 100 篇文章已經全部完成,而且品質比我預期更好。接著看到 API 支出約 100 美元時,我真的嚇了一跳,也因此開始研究:能不能先用高階模型建立方法,再讓價格較低的模型完成剩餘文章?
| 實測項目 | GPT-5.6 Sol | GLM-5.3 Flash |
|---|---|---|
| 文章數 | 100 篇 | 76 篇 |
| API 支出 | 約 100 美元 | 約 4 美元 |
| 平均每篇 | 約 1 美元 | 約 0.0526 美元 |
當時 OpenRouter 顯示,GPT-5.6 Sol 每百萬輸入/輸出 Token 為 2/10 美元;GLM-5.3 Flash 促銷價為 0.075/0.25 美元。成本降低很大一部分來自模型牌價,流程的價值則是讓低成本模型在驗收保護下承接工作。GPT-5.6 Sol 定價、GLM-5.3 Flash 定價
1/19 只適用於這次兩批任務,沒有包含訂閱月費、Prompt 設計、跨模型檢查與我投入的大量人工抽查時間。GLM 的 API 成本很低,但不能因此解讀為整體專案幾乎不需要人力。
哪些工作適合交給 AI Agent?
適合交給 AI Agent 的工作,通常具備三個條件:需要大量重複、規則能夠寫清楚、結果可以驗收。涉及高風險判斷、模糊目標或責任歸屬的工作,仍應由人主導。
文章重整只是其中一個案例。相同方法也能應用在資料分類、表格整理、報告格式化、文件搬移、欄位補齊與初步檢查。
判斷一項工作能不能交給 AI Agent,可以先問:
- 能不能清楚寫出輸入、步驟與完成條件?
- 錯誤能不能被程式或清單發現?
- 失敗後能不能只重跑受影響的部分?
- 哪些例外必須交回人工判斷?
如果只能告訴 AI「幫我做好」,卻無法說明什麼叫完成,就還不適合直接大規模自動化。
AI Agent 批次工作常見問題
AI Agent 批次工作的核心,不是一次處理越多越好,而是每一項任務都有狀態、錯誤能被定位、失敗可以重跑。先用小批次驗證,再逐步放大,比直接追求全自動更可靠。
一次可以讓 AI Agent 處理多少篇?
沒有固定答案,會受到文章長度、模型、平台限制與代理調度方式影響。我曾一次處理數十篇,也曾在健身課期間完成約 100 篇;實務上仍建議先從 10 篇開始測試。
Prompt 寫得夠完整,就不需要檢查嗎?
不行。DeepSeek 即使收到禁止提及「原文」的指令,仍可能重複出現;GLM 也可能在主文完成後漏掉 FAQ 或圖片。Prompt 是規格的一部分,驗收與重跑機制同樣重要。
為什麼開放權重模型需要搭配 Agent?
模型本身主要負責理解與生成;Hermes Agent 則提供讀寫檔案、呼叫工具、分配 Sub-agent、保存工作方法與持續執行的能力。這次成果來自「模型+Hermes Agent+明確方法+多輪驗收」,不能理解成單用 GLM 或 DeepSeek 就能直接完成 530 篇文章。
參考資料
本文的模型價格來自 OpenRouter 公開資料;530 多篇文章的模型表現、Mapping 流程、三輪驗收與實際支出,來自我的第一手專案紀錄。
延伸閱讀
- AI 搜尋引擎優化怎麼做?技術文章寫得夠專業,為什麼 AI 還是不引用:同樣聚焦這批 530 多篇文章,可接著了解一篇文章要具備哪些條件才容易被 AI 引用。
- AI Agent 落地五層診斷:同樣聚焦 AI Agent 導入,可接著比較不同情境下的落地方法。
- 企業導入前必懂的 MCP、Skills、Automation:同樣聚焦 AI Agent 的規格化執行,可接著了解 Skill 化流程背後的技術概念。
關於作者
Claire Chang | 企業 AI 導入與流程轉型顧問。專注於 AI Agent 架構設計、ERP 系統整合與企業 AI 治理。
首次發布:2026-08-28
