AI Agent 跑到一半停了?先分 3 型再修
文 / Coolkid發布:2026-08-12閱讀約 8 分鐘

短答給趕時間的人:AI Agent 半路停掉,先看「怎麼停的」分 3 型。(1) 額度型:有訊息提到 limit,那不是壞掉,是額度用完,等重置就好 (2) 錯誤型:有紅字錯誤訊息,把訊息整段複製貼回去問 AI,多數 10 分鐘內有解 (3) 靜默型:什麼都沒說就停了,最危險,因為你可能過了三天才發現。修法 4 步:先問做到哪、判斷這件事敢不敢重跑、讓 AI 養成「先記帳再動作」的習慣、失敗通知要能煩到你為止。我的發文機器人斷發過 3 篇才學會這套。
這篇的學費我繳過兩次。
2026-07-02 我對帳才發現,自動發文機器人有 3 篇文該發沒發。
程式其實沒出錯。機器人遇到問題時「通知過我一次」,而我沒看到。
然後機器人就當作交代完了,永遠地跳過。
十天後同一類問題再犯,這次漏了 5 篇。
兩次事故的共通點都不是「AI 不夠聰明」,是我沒替失敗設計退路。
這篇把非工程師也做得到的退路講完。
第一步永遠是分型:它是怎麼停的?
跟人看病一樣,先分科再治療。AI Agent 半路停掉只有 3 種停法,判斷只要 30 秒:
- 額度型。畫面或紀錄裡有 limit、quota、rate 這類字眼,那不是故障,是用量到了。等額度重置,或看「額度用完」那篇的省法。特徵:等就會好,重裝不會好。
- 錯誤型。有明確的紅字錯誤訊息,這是最好處理的一型。把錯誤訊息「整段」複製,貼回去跟 AI 說「跑到這裡出現這個錯」。別自己先摘要,錯誤訊息裡你覺得是亂碼的部分往往才是關鍵。
- 靜默型。沒有任何訊息,就是停了;或者更難察覺的那種,看起來跑完了,但該發生的事沒發生(文沒發出去、檔案沒生出來)。這是本篇主角,往下看。
判斷口訣:有講 limit → 等;有紅字 → 貼回去問;什麼都沒講 → 這篇繼續讀。
我斷發 3 篇的實錄:為什麼靜默型最危險?
先講案發經過,因為這個失敗模式你遲早會遇到。
我的發文機器人每天自動發一篇連載,某幾篇的文案還沒準備好,機器人的設計是「發一則通知提醒我手動處理」。
聽起來很合理,對吧?
結果通知發了,我沒看到,機器人覺得自己交代完了,隔天繼續處理下一篇。
2026-07-02 我對帳的時候才發現,連續 3 篇就這樣無聲地斷掉,而系統的每一個環節都回報「沒有出錯」。
十天後的 2026-07-12,同類問題第二次發生,這次漏了 5 篇。
原因是另一個盲點:有一批排程文對系統的檢查邏輯「隱形」,連通知都不會發。
兩次事故合起來教會我一件事。
機器人停掉本身不算大事,真正麻煩的是停掉之後沒有人知道。
因為畫面上一切正常,你根本不會想去查,等到對帳才發現已經漏了好幾天。
你的自動化越順,你越不會去看,斷掉的那天就越晚發現。
對應的設計原則其實很簡單:與其想辦法讓這套流程永遠不失敗,不如確保它失敗的那一刻,你一定會知道。具體做法在下一節的第 4 步。
修復 4 步:從「它停了」到「安全地接回去」
- 第 1 步,先問進度,別先重跑。跟 AI 說「剛剛的任務做到哪一步?列出已完成和未完成的清單」。它讀得到自己的紀錄和產出物,多數時候答得出來。跳過這步直接重跑,是新手最常見的二次事故來源。
- 第 2 步,判斷這件事「敢不敢重跑」。問自己一題:已完成的部分再做一次,會出事嗎?整理檔案、重抓資料不會,放心重跑;發文、寄信、扣款會重複,必須先讓 AI 跳過已完成的部分(跟它說「從第 N 步繼續,前面做過的跳過」)。
- 第 3 步,讓它養成「先記帳再動作」。對會重複出事的任務,叫 AI 改成「每完成一步,先寫進一個進度檔,動作之前先查進度檔」。我的發文機器人修復後就是這個機制:發文前先標記,重跑時看到標記就跳過,從此不怕重複發。這句話你可以原樣抄給 AI:「幫這個流程加上進度紀錄,讓它可以安全重跑」。
- 第 4 步,失敗要能吵到你。通知發一次是不夠的(我就是這樣漏的)。規則改成「問題沒解決,每天再提醒一次」,用 Telegram 或 LINE 這種你一定會看的管道。事故後我的機器人加了每日重複提醒,同型問題再也沒斷超過一天。
兩次定律:同一個做法最多試兩次
最後一個判斷,反而是新手最缺的。
同一個做法,原封不動地失敗兩次,就不要試第三次。
第三次會成功嗎?機率不會比較高。你只是在重播失敗。
連錯兩次代表你對問題的假設錯了,該換的是假設,不是運氣。
換假設要做什麼?把「重試」改成「換路」。
舉例來說,同一支程式在排程裡連掛兩次,先手動跑一次看看。
手動能過、排程就掛掉,那問題根本不在程式本身,而是在排程的執行環境(這正是我的中文亂碼那篇的劇情)。
像是同一個指令連兩次沒反應。別再下第三次。
改問 AI「這個指令沒反應,幫我列出 3 個可能原因和各自的檢查法」,把 AI 從「執行者」切回「醫生」,常常一輪就找到真正的病灶。
AI Agent 跑到一半停了,先花 30 秒分 3 型:額度型(訊息含 limit,等重置,重裝沒用)、錯誤型(有紅字,整段貼回去問 AI)、靜默型(什麼都沒說,最危險)。靜默型實錄:我的發文機器人 2026-07-02 被發現無聲斷發 3 篇,一次性通知沒人看到就永遠斷;2026-07-12 同類問題再漏 5 篇。修復 4 步:先問「做到哪一步」別急著重跑,判斷敢不敢重跑(發文、寄信類會重複,要跳過已完成),讓 AI 加「先記帳再動作」的進度紀錄變成可安全重跑,失敗通知改成沒解決每天吵你。加一條兩次定律:同一做法原樣失敗兩次就換假設,不試第三次。核心原則:與其追求永不失敗,不如確保失敗一定看得見。
名詞解釋
- AI 代理(AI agent)
- 會「動手做事」的 AI:自己讀檔案、寫程式、跑指令、修錯誤,你只負責描述需求跟監督方向。跟只會「回答問題」的聊天機器人是兩種東西。
- 機器人(bot)
- 自動執行特定任務的程式,例如 LINE 機器人自動回訊息、發文機器人每天定時發貼文。
- 排程(cron)
- 讓程式「每天 8 點」「每小時」自動執行的定時器。自動發文、定期抓資料都靠它。
- rate limit(用量限制)
- 服務商限制你在一段時間內能用多少次的機制。撞到不是壞掉,是「這個時段的量用完了」,等重置或升級方案。
- 自動化(automation)
- 把重複性工作交給程式定時自動執行,例如每天早上自動抓新聞、整理成貼文、發到社群。
▸ 常見問題
AI Agent 停了,但沒有任何錯誤訊息,怎麼查?
這是靜默型,先跟 AI 要進度:「剛剛的任務做到哪一步?列出已完成和未完成」。再查三個地方:額度面板(很多「沒訊息」其實是額度到了)、任務的執行紀錄(排程平台都有 log)、最終產出(文有沒有真的發出去、檔案有沒有真的生成,「看起來跑完」和「真的完成」是兩回事)。查完至少知道是哪一型,再對症處理。
任務重跑一次,會不會把做過的事再做一遍?
取決於任務性質,重跑前先問一題:已完成的部分再做一次會出事嗎?整理檔案、重抓資料再做一次無害;發文、寄信、扣款再做一次就是事故。後者的解法是讓 AI 加「先記帳再動作」機制:每完成一步寫進進度檔,動作前先查、做過就跳過。一句話抄給 AI:「幫這個流程加上進度紀錄,讓它可以安全重跑」。我的發文機器人加了這個機制後,重跑再也不會雙發。
半夜自動跑的任務失敗了,怎麼第一時間知道?
兩個設計。(1) 成功失敗都要通知,用 Telegram 或 LINE 這種你一定會滑到的管道;只通知失敗的話,「完全沒消息」跟「跑成功」你分不出來。(2) 沒解決就重複提醒,一次性通知會被漏掉(我的機器人就這樣斷發 3 篇,2026-07-02 對帳才發現),規則改成問題存在一天就每天提醒一次,直到有人處理。
AI 一直重試同一個錯誤,該讓它繼續試嗎?
不該。同一個做法原封不動失敗兩次,第三次成功的機率不會更高,連錯兩次代表假設錯了,不是運氣差。把 AI 從執行者切回醫生:「這個做法連續失敗兩次,停止重試,列出 3 個可能的原因和各自的檢查方法」。另一招是換環境對照:排程裡連掛兩次的程式,手動跑一次看看,手動能過排程掛掉,問題就在執行環境不在程式,查的方向完全不同。
看完這篇之前先確認:
- AI 自動化任務跑到一半不動了,不知道從哪查起的人
- 半夜的排程失敗了都沒人知道,事後才發現開天窗的人
- 想知道「重跑一次」安不安全的人
- Claude Code 對話中卡住沒反應 (那是另一篇「卡住沒反應」的範圍)
- 找企業級監控系統教學的人 (這篇是個人自動化的土砲防線)
- 任務還沒開始跑就報錯 (先看安裝失敗/登入那兩篇排查)
