Claude Code 省 token:設定好讓它自己省,不用記複雜用法
文 / Coolkid發布:2026-09-10閱讀約 16 分鐘

短答給趕時間的人:網路上的省 token 教學整理起來有十幾條,全部要你「記得」——記得切換任務前打 /clear、記得給輸出多的指令加靜默參數、記得別在長對話貼大檔案。這些做法本身沒錯,問題是沒有人記得住十幾條紀律。能設定掉的其實不少:對話到多少要自動整理,可以自己定;要它想多深,可以先鎖住;指令吐出來的一大堆訊息,可以先過濾再給它看;裝了用不到的工具包,加一行設定就不佔位置。下面先看你還沒開始打字就花掉多少,再一項一項換成設定。
我從 2026 年 4 月中開始用 Claude Code,撞過幾百次額度上限。
每次撞完都會去找省 token 的方法,找到的東西也都很合理。
然後過三天就忘光了。
不是那些方法不好,是「要記得」這件事本身就不可靠。工作到一半的時候,腦子裡想的是手上那個 bug,不會想到「我等一下該打 /compact」。
所以這篇換一個方向:哪些事情可以交給設定,自動發生。
為什麼「記得省 token」很難?
因為那些方法要求你在工作最投入的時候分心去想省錢,而人在投入的時候剛好最不會分心。
我把中文圈教省 token 的文章整理過一輪,去掉重複的還有十幾條。
切換任務就清空對話、離開前先壓縮、用 @ 直接指檔案不要讓 Claude 自己找、輸出多的指令加靜默參數、簡單任務換小模型、長文件先轉成純文字再貼、別在對話裡累積截圖、多個問題併成一則問。
每一條單獨看都很有道理。
但你要同時記住十幾條,而且要在每一次對話裡都記得。
所以看完教學隔天就忘光了。習慣要靠重複做才養得起來,而省 token 這件事沒有立即回饋——你今天多打一次 /clear,做小任務的時候可能就很沒感覺。
沒有回饋的習慣就很難養成。
判斷原則:一件事如果「做了沒感覺、不做也沒感覺」,就不要靠意志力,想辦法變成預設值。下面每一節都是照這個原則挑的。
你還沒開始打字,就已經花掉多少 token?
官方文件有一個互動模擬,把一次對話從開機到結束的每一筆花費攤開來。在打第一個字之前,已經載入了七千多個 token。
這是那份模擬情境裡的數字,你自己的機器會因為裝了什麼而不一樣,但比例大致是這樣。
| 開機時載入的東西 | token | 誰決定它的大小 |
|---|---|---|
| 系統提示(Claude 的行為說明書) | 4,200 | 官方,動不了 |
| 專案的 CLAUDE.md | 1,800 | 你寫的 |
| 自動記憶 MEMORY.md | 680 | Claude 自己寫的,前 200 行 |
| skill 的一行描述清單 | 450 | 你裝了幾個 |
| 全域 CLAUDE.md | 320 | 你寫的 |
| 環境資訊(目錄、系統、git 狀態) | 280 | 官方,動不了 |
| MCP 工具名稱清單 | 120 | 你接了幾個 |
| 你打的那句話 | 45 | 你 |
看那張表最後兩列的對比:真正打出來的那句問題是 45 個 token,在那之前已經先花掉七千四百個。
而且這七千四百是每一次新對話都要重來一遍的。
重點在於,這裡面有一半以上是你的設定決定的,不是你打字打出來的。專案的 CLAUDE.md 一千八、全域的三百二、skill 清單四百五、MCP 清單一百二——這四項加起來快兩千七,全部來自你裝了什麼、寫了什麼。
所以省 token 的第一件事不是改習慣,是回頭看這幾個檔案。
官方對 CLAUDE.md 的建議是控制在 200 行以內,只放真正必要的。細節與流程搬到 skill 裡,需要的時候才載入。
我自己的全域 CLAUDE.md 也是這樣一路砍下來的。一開始什麼都想寫進去,後來發現寫進去的東西,在做完全不相關的事情時也一樣在付錢。
哪些設定可以一次設好就不用再管?
有四項是設定一次就長期生效的:自動壓縮的門檻、推理強度、預設模型,還有 MCP 工具的載入方式。
自動壓縮門檻是最直接的一項。對話長到一定程度,Claude Code 會自己把前面的內容壓縮成摘要,這個門檻你可以自己定。
指令是 /autocompact,後面接一個 token 數。接受的寫法有幾種:直接寫 500000、寫 500k,或者寫 500 代表五十萬。範圍是十萬到一百萬。
不設的話,用一百萬窗口的模型大約會撐到九十六萬七千才壓縮。設低一點,Claude Code 會比較早開始整理,每一輪要重讀的東西就少。
這件事對應到的人工紀律是「記得離開前打 /compact」。設定好之後就不用記了。
推理強度是第二項。同一個模型可以想得淺一點或深一點才回答。想得越深,花掉的 token 越多。
指令是 /effort,等級有 low、medium、high、xhigh、max,多數模型預設是 high。改設定檔或啟動時加參數也可以。
官方對每一級的說明很直白:low 給短而明確、不吃智力的任務;medium 給願意用一點準確度換成本的工作;high 是平衡點;max 給真的很難的題目,而且可能會想太多。
重點是開始工作前就把等級定下來,不要做到一半才切換。前面聊過的內容本來可以用便宜的價錢重算,中途換模型或換強度就會失效,整段對話要按原價再算一次。
這個便宜價有時效。同一段對話隔一小時內回來還算得到,超過就要按原價把整段重算一次。
所以「離開前先壓縮」這句話,重點在「離開前」。等到隔天回來才想到要整理,那次整理本身就是按原價跑的。開了用量點數的話時效更短,額度多久重置那篇有寫。
MCP 工具的載入方式是第三項,也是最多人不知道的。
預設情況下,Claude Code 只先記住有哪些工具可以用,每個工具的詳細說明書要等真的要用時才去拿。上面那張表裡 MCP 只佔 120 個 token,就是因為預設是這樣。
如果你把 ENABLE_TOOL_SEARCH 設成 false,就會變成一開始全部載入。接了幾個 server 之後,這個差距會很可觀。
所以這一項不用動,讓預設值留著。想確認自己現在是哪一種,打 /context 看 context 裡裝了什麼。
這四項的共同點:都是你在還沒開始工作、腦子還清醒的時候設定的。工作中要記得的事情越少,越可能真的做到。
怎麼讓 AI 根本不用讀那麼多?
比省著讀更有效的做法是減少要讀的量。有三個方向:讓 hook 先過濾、讓 skill 直接給答案、把用不到的 skill 收起來。
讓 hook 先過濾是官方文件自己給的範例。
情境是這樣:你叫 Claude 跑測試,測試吐出一萬行結果,那一萬行全部進了對話,而且之後每一輪都要跟著重讀。
但你真正要看的只有失敗那幾行。
hook 是一小段程式,會在 Claude 動手做事之前或之後自動跑一次。官方的範例是掛一個在動手前跑的 hook:發現這次要跑的是測試,就自動幫指令加上「只印失敗那幾行」的條件。Claude 看到的就從一萬行變成幾十行。
對應的人工紀律是「記得給輸出多的指令加靜默參數」。掛一次 hook,以後每一次都自動生效。
讓 skill 直接給答案是第二個。
沒有 skill 的時候,Claude 要搞懂你的專案結構,得讀五六個檔案慢慢拼。把架構、目錄慣例、命名規則寫成一個 skill,讓 AI 跑一次就拿到了。
我自己更常用的是另一種:把整段大工程搬出對話。我的爬蟲工作全部走一個共用引擎,Claude 只需要下一行指令,抓回來的原始資料不會進對話。
這跟 skill 是同一個道理——讓需要大量閱讀的部分在對話外面完成。
把用不到的 skill 收起來是第三個,而且是我自己走過冤枉路的一項。
每個裝著的 skill 都會放一行描述進 context,讓 Claude 知道有這個東西可以用。裝得越多,那份清單就越長。
我之前的做法是把不常用的 skill 整批搬到另一個資料夾,需要時再搬回來。實測下來每個請求只省一千個 token 左右,搬進搬出的麻煩遠大於省下的量。
後來才知道官方有更省事的做法:在那個 skill 的設定裡加一行 disable-model-invocation,意思是「不讓 Claude 自己叫用」。加了之後那個 skill 就完全不進清單,只有你自己打斜線指令叫它出來才載入。
不用搬檔案,也不會忘記自己有這個工具。這是我接下來要改的。
派工給便宜的模型了,為什麼還是省不了?
因為派工出去不等於主模型離場。它還在場上,而且每一輪都要把整段對話重送一次。
我自己的設定是讓最強的模型負責規劃,實際動手交給比較便宜的模型。照理說這樣會省很多。
2026 年 9 月初有一週我去看用量,最強那個模型的額度條已經到 81%,全模型合起來的那條才 50%。
換算之後我才發現,那 50 分裡面最強那個模型一個人吃掉四十分,其他所有模型加起來不到十分。
分工設計省下來的,不到兩成。(兩條額度條怎麼算,寫在Claude Fable 額度那篇。)
問題不在派工沒生效,在派工了但主模型還在場。
主對話的花費不是「它講了幾句話」,而是「對話多長 × 講了幾輪」。每一輪都要把前面全部重送一次,所以對話越長,每一輪越貴。
派出去的小任務便宜,是因為那個小任務有自己獨立的對話空間,做完就消失。
但派出去的任務回報給你的內容會留在主對話裡。那份報告有多長,接下來每一輪就多付多少。
照這個邏輯回頭看,漏水的地方有四個,我按嚴重程度排:
- 主模型自己讀檔案。讀進來一個 500 行的檔,接下來三十輪每一輪都在重付這 500 行。這是最大宗。
- 派出去的任務回報太長。派工的時候沒限制長度,回來一份兩百行的報告,那兩百行就開始按輪計費。
- 一步一步盯著看。派一個、看結果、再派下一個——每次「看結果」都是一整輪的完整對話。應該一次把整包丟出去。
- 同一個對話開太久。對話長度到後來會讓每一輪的成本翻好幾倍。
前兩個可以直接寫進設定。派工的模板加一句硬規則:回報不超過十五行,只給結論跟檔案路徑,不要貼程式碼。
規劃階段要看程式碼,也一律派出去看,主模型自己不開檔案。
講到這裡會冒出一個念頭:既然派出去的任務有自己的空間,那乾脆反過來——平常用便宜的模型,要規劃的時候才把最強的那個派出去做?
派得出去。官方文件寫明派工時可以指定模型,指定成比主對話更高階的也可以,文件自己給的範例就是「主對話跑便宜的、派出去的跑貴的」。派工的用法在這篇。
但規劃這件事派出去,有兩個過不去的地方。第一,派出去的任務看不到你們之前聊了什麼。它拿到的只有你派工那一則訊息、CLAUDE.md 跟環境資訊,你在主對話講了半天的來龍去脈,一個字都不會跟過去。
你得在派工訊息裡把脈絡重打一遍。那份訊息本身要錢,而且很難真的重述完整。
第二,派出去的任務不能問你問題。規劃到一半需要你決定「A 還是 B」的時候,它只能自己猜,或者回報說需要你確認然後就結束,你再開一輪重派。
官方也直接寫了什麼時候該留在主對話:需要來回討論的、需要一邊做一邊調整的,還有規劃跟實作要共用大量脈絡的。規劃兩條都中。
所以真正適合派出去的規劃只有一種:輸入是檔案不是對話、一次講得清、不用跟你商量。像「讀這個專案給我一份重構計畫」就很適合。要跟你來回的那種,留在主對話反而便宜。
這一節是我 2026 年 9 月初查自己用量時才發現的。設定了分工不代表真的省到——要對照兩條額度條的絕對數字,光看百分比會以為分工有效。
別人教的那些方法,哪些可以自動化?
把前面整理的十幾條人工紀律對回設定,大概一半可以自動化,一半還是得靠自己。
| 別人教你「記得」 | 能不能設定掉 | 怎麼設 |
|---|---|---|
| 切換任務就清空對話 | 半自動 | 自動壓縮門檻設低一點,Claude Code 會自己整理 |
| 離開前先壓縮對話 | 可以 | 同上,設定門檻就不用手動打 |
| 輸出多的指令加靜默參數 | 可以 | 掛 PreToolUse hook 自動改寫指令 |
| 開始前鎖定模型與推理強度 | 可以 | 寫進設定檔,不要工作中途切換 |
| 關掉用不到的工具 | 可以 | MCP 保持預設(要用才拿說明書);skill 加 disable-model-invocation |
| 用 @ 直接指檔案不要讓 Claude 找 | 半自動 | 把架構寫成 skill,就不用翻檔案 |
| 派工給便宜的模型執行 | 半自動 | 派工模板寫死回報上限;規劃階段不自己開檔案 |
| 簡單任務換小模型 | 半自動 | 設定預設模型;真的要換還是得自己判斷 |
| 長文件先轉純文字再貼 | 不行 | 這是貼之前的動作,只能自己記 |
| 別在長對話累積截圖 | 不行 | 同上 |
| 多個問題併成一則問 | 不行 | 這是打字習慣 |
剩下那三條不行的有一個共同點:都發生在你按下送出之前。
設定管得到對話裡面發生的事,管不到你手上要貼什麼。
所以真正要靠意志力的只剩三條,比原本十幾條好記多了。
我自己的順序是先把設定那幾項調好,再回頭養這三個習慣。
前面說過我試過先養習慣那條路,三天就忘光。先把能自動的自動掉,剩下的少到記得住,成功率才會高一點。甚至已經省了大部分,剩下幾條也不一定要追求極致。
還沒開始的話,建議的順序是:先打 /context 看自己現在裝了什麼、再砍 CLAUDE.md、然後設自動壓縮門檻與推理強度、最後才掛 hook。前三步不用寫程式,效果也最直接。
省 token 的教學幾乎都在教你記得做什麼,但要同時記住十幾條紀律不切實際,而且省下來的量沒有立即回饋,習慣養不起來。官方模擬顯示,在你打第一個字之前已經載入七千四百個 token,其中專案 CLAUDE.md 佔一千八、skill 描述清單四百五、MCP 清單一百二,這幾項都由你的設定決定,不是打字打出來的。能設定掉的有四項:對話多長要自動整理,用 /autocompact 設一個 token 數,範圍是十萬到一百萬;要它想多深,用 /effort 鎖住,而且不要做到一半才換,換了前面聊過的內容就不能用便宜價重算;常用的模型寫進設定檔;工具的說明書保持預設,要用到才去拿。更進一步是減少要讀的量:掛一個 hook,讓測試結果先過濾成只剩失敗那幾行再給它看;把專案架構寫成 skill,省下它翻檔案的來回;用不到的 skill 加一行 disable-model-invocation,就完全不佔位置。還有一件事光調設定看不出來:派工給便宜的模型執行,主模型還是在場,每一輪都要把整段對話重送一次。我 2026 年 9 月初查自己的用量才發現,分工只省了不到兩成,漏水最大的是主模型自己讀檔案,其次是派出去的任務回報太長,這兩個都可以在派工模板裡寫死。想反過來、平常用便宜的模型而規劃時才把最強的派出去也做得到,官方允許派工時指定更高階的模型;但派出去的任務看不到你們之前聊過什麼,也不能問你問題,所以只有「輸入是檔案、一次講得清、不用商量」的規劃適合這樣派。十幾條人工紀律裡大約一半可以自動化,剩下的三條都發生在按下送出之前——貼檔案前先轉純文字、別累積截圖、多個問題併成一則,那三條只能自己記。
名詞解釋
- token(字元計費單位)
- AI 讀寫文字的計量單位,一個中文字約 1-2 個 token。訂閱方案的用量限制、API 的計費都是按 token 算,所以「講重點、少貼無關內容」直接等於省錢。
- context(上下文視窗)
- AI 一次能「記在腦中」的內容上限,包含你說的話、它讀的檔案跟對話紀錄。塞滿了就會忘掉前面的事,這就是長對話後 AI 開始恍神的原因。
- skill(技能包)
- Claude Code 的知識外掛:一個資料夾放一份說明書(SKILL.md),教 AI 特定領域的做事方法。對到相關任務時 AI 會自己翻出來照著做。
- hook(掛鉤)
- 在工具的固定時機(開始對話、寫完檔案、結束回合)自動執行你指定動作的機制。像是幫 AI 設「進門要換鞋」的家規,設一次每次都自動生效。
- MCP(Model Context Protocol)
- 讓 AI 工具安全連接外部服務(瀏覽器、行事曆、資料庫)的通用接口標準,由 Anthropic 推出。
- system prompt(開場說明書)
- 每次對話開始前,系統先塞給 AI 的背景說明:你是誰、有哪些工具、裝了哪些 skill。使用者看不到它,但每一次請求都會重送一遍,是固定開銷的大宗。
- Claude Code
- Anthropic 推出的 AI 寫程式工具,裝在自己電腦的終端機裡,能直接讀寫你的檔案、跑指令,把你用中文描述的需求做成真的網站或工具。
- 斜線指令(slash command)
- Claude Code 對話裡以 / 開頭的快速指令,例如 /compact、/model。除了內建的,也能把自己常用的一段指示存成檔案變成自訂指令,打 / 加名字直接執行。
如果內容對你有用就太好了
隨喜斗內
常見問題FAQ
Claude Code 省 token 最有效的一招是什麼?
先看設定不是先改習慣。官方模擬顯示開機就載入七千四百個 token,其中專案 CLAUDE.md 一千八、skill 描述四百五、MCP 清單一百二都由你的設定決定。把 CLAUDE.md 控制在 200 行以內、細節搬進 skill,效果比記得多打幾次指令直接。
自動壓縮的門檻要設多少?
指令是 /autocompact 加一個 token 數,接受 500000、500k 或 500 這幾種寫法,範圍是十萬到一百萬。不設的話,一百萬窗口的模型大約撐到九十六萬七千才壓縮。設低一點會比較早整理,每一輪要重讀的內容就少。
為什麼不要在對話中途換模型或改推理強度?
因為前面聊過的內容本來可以用便宜的價錢重算,換掉就失效了。一旦換模型或換強度,整段對話要按原價再算一次。建議在開始工作前就用 /effort 或設定檔把等級定下來。
裝很多 skill 會不會很花 token?
每個 skill 都會放一行介紹進去,讓 Claude 知道有這個東西可以叫,官方模擬裡這份清單是四百五十個 token。不想讓某個 skill 佔位置又不想刪掉,可以在它的設定裡加一行 disable-model-invocation,意思是不讓 Claude 自己叫用。加了之後就完全不進清單,只有你打斜線指令叫它出來才載入。
hook 是什麼?不會寫程式可以用嗎?
hook 是一小段程式,會在 Claude 動手做事之前或之後自動跑一次,可以在它看到結果之前先處理一遍。官方的範例是把一萬行的測試結果先過濾成只剩失敗那幾行。設定要寫一小段腳本,不會寫程式的話可以先做前面幾項——砍 CLAUDE.md、設壓縮門檻、鎖推理強度,這三件都不用寫程式。
哪些省 token 的做法沒辦法設定掉?
發生在你按下送出之前的都不行:長文件先轉成純文字再貼、別在長對話裡累積截圖、多個問題併成一則問。設定管得到對話裡面發生的事,管不到你手上要貼什麼。
看完這篇之前先確認:
- 看過一堆省 token 教學 但一條都沒真的養成習慣
- 想知道哪些省法可以設定一次就不用再管
- 已經在用 CLAUDE.md 或 skill 想知道它們花掉多少
- 還沒撞過額度上限 (先看額度怎麼算那篇)
- 用 API 按量計費 (這篇講訂閱制的 Claude Code)
- 想找「無限用量」的偏方 (沒有這種東西)
