很多企業第一次導入 AI,是從一個聊天機器人開始的。客服問答、內部知識查詢、幫同仁改一封 email。帳單很小,小到採購單位不太在意,資訊部門也覺得這筆錢跟訂閱一套 SaaS 差不多。問題出在第二階段。當貴司把同一個模型接上 ERP、核心系統、病歷系統或公文系統,讓它從「回答一個問題」變成「完成一件任務」,帳單的形狀就完全變了。
研究機構 Gartner 在 2026 年 3 月的預測中給了一個數字:代理式 AI(AI Agent)完成一件任務所消耗的 token,是一般生成式 AI 聊天機器人的 5 到 30 倍。同一份報告用了一個更直白的換算,聊天機器人只要 0.01 美元的任務,交給 AI Agent 可能要花到 1.50 美元。這不是模型變貴了,而是工作方式變了。這篇文章要拆的,就是這個倍數從哪裡來,以及為什麼傳統的預算編列方式看不見它。
一個問題與一件任務,差在哪裡
先把兩種用法放在一起看。使用者問聊天機器人「這張發票的稅額怎麼算」,模型讀一次問題、寫一次答案,一來一回,幾百到兩千個 token 結束。這是一個問題。
換成 AI Agent 處理「把這個月的供應商發票全部核對、入帳、產出異常清單」。Agent 要先讀取任務與系統說明,規劃步驟,呼叫工具去抓發票,讀回結果,比對採購單,發現不符再查一次,寫入帳務系統,確認寫入成功,最後產出報告。每一步都是一次模型呼叫,而且每一次呼叫,模型都要把前面累積的所有上下文重新讀一遍:系統提示、任務說明、之前每一步的工具回傳結果。走到第二十步,前面的內容已經被重複計費二十次。
聊天機器人的成本隨「問題數量」線性成長。AI Agent 的成本隨「任務步數」以接近平方的方式成長,因為每一步都要重讀之前所有步驟。
這就是 5 到 30 倍的來源。而且 Gartner 給的是一般任務的區間。在更長鏈路的場景,公開的量測數字還要高得多。EY 的分析指出,一次客服互動的成本從 2023 年約 0.04 美元,上升到 2026 年約 1.20 美元,增加了大約三十倍,原因就是單純的問答被多工具協作的 Agent 流程取代。針對軟體開發任務的學術研究更量到,程式 Agent 消耗的 token 可以達到一般聊天互動的一千倍,而且絕大部分來自模型反覆重讀的輸入端,不是它產出的輸出端。
單價一直降,帳單為什麼還一直漲
這是預算單位最常提出的質疑:各家模型的每百萬 token 單價這三年明明降了好幾成,為什麼總帳單反而往上走?答案分成三層。
- 用量結構變了。單價降的是每個 token,但一件任務用掉的 token 數增加了 5 到 30 倍,甚至更多。單價下降的幅度追不上用量結構的變化。
- 任務數量變了。聊天機器人一天被問幾百次就算多。AI Agent 是被排程跑的,一晚上可以處理上萬張單據,每一張都是一條長鏈路。Gartner 在 2026 年 8 月進一步預測,每個代理式工作流的推論成本到 2028 年還會再上升五倍以上,理由正是任務會越來越長、越來越複雜。
- 模型選擇變了。Agent 要做決策、要用工具,通常需要能力較強的模型才不會在中途出錯。強模型的單價本來就是輕量模型的十倍以上。
三層疊在一起,就是「單價降了好幾成、帳單漲了好幾倍」這個看起來矛盾的現象。Gartner 對此的判斷很直接:代理式 AI 不會享受到規模經濟,做得越多、花得越多。
為什麼傳統預算編列看不見這條曲線
銀行的資訊處、醫院的資訊室、製造集團的 IT 部門、政府機關的資訊單位,編預算的邏輯是相似的:軟體授權按人數或年費,硬體按台數,雲端按核心數與儲存量。這些都是「容量」型的成本,上限在採購當下就決定了。
AI Agent 的 token 費用是「用量」型的成本,而且用量不是由人數決定,是由「Agent 被賦予多少任務、每個任務走多少步」決定。這帶來三個傳統預算表處理不了的問題:
- 沒有上限。一個寫得不好的 Agent 在半夜因為工具回傳錯誤而不斷重試,一個晚上可以燒掉一個月的預算。這不是假設,是所有做過 Agent 的團隊都遇過的事。
- 歸不了戶。API 帳單只告訴貴司「這個月用了多少 token」,不會告訴貴司是哪個部門、哪個流程、哪一種任務用掉的。沒有歸因,就沒辦法決定哪個流程值得繼續、哪個該停。
- 算不出投資報酬。採購單位要看每個案子的效益,但 Agent 的成本跟效益都藏在同一張總帳單裡。結果是專案要不就被砍,要不就用「先試試看」的名義無限期掛著。
Gartner 另一份預測指出,到 2027 年底會有超過四成的代理式 AI 專案被取消,原因是成本上升、商業價值不明確或風險控管不足。這三個原因裡有兩個,直接來自上面這張看不見的曲線。
看見曲線之後,能做什麼
品得網絡在協助企業處理 AI 用量成本時,第一件事從來不是換模型或砍功能,而是先埋點量測。每一次模型呼叫都要帶上部門、流程、任務類型的標籤,把總帳單拆回每一條業務線。做到這一步,通常就能看出三種典型的浪費:
- 快取被自己破壞。各家供應商都提供提示快取(prompt caching),重複的前綴可以打折。但只要系統提示裡放了時間戳記或隨機排序的內容,快取就永遠打不中,企業往往自己不知道。
- 該批次的沒批次。不急著要答案的任務(夜間對帳、週報生成)可以走批次介面,各家都有半價左右的定價。
- 殺雞用牛刀。Agent 流程裡有八成的步驟是格式轉換、簡單判斷,不需要最強的模型。分級路由讓每一步用剛好夠用的模型。
這些做法能省多少,取決於貴司現在的用法有多粗放,所以品得網絡從不在量測之前承諾數字。但可以確定的是:看不見曲線的企業,只有兩條路,要不就是被帳單嚇到停用,要不就是被迫無上限地付。看得見的企業,才有第三條路。
這個系列接下來要談什麼
成本結構只是第一層。當貴司的 AI Agent 開始碰核心帳務、病歷、公文,把整條鏈路建在外部 API 上,還有比成本更根本的問題。這個系列共五篇,每兩天一篇:
- 第二篇:三家同時斷線的那個早上:把 AI Agent 建在外部 API 上的三個結構性風險
- 第三篇:買了 GPU 不等於有算力:自建 AI 基礎設施的四道關卡與破解法
- 第四篇:從機櫃到 Agent:算力層要具備的五個治理能力,以及三條實作路線怎麼選
- 第五篇:API、自建、混合:給銀行、醫院、製造與公部門的 AI Agent 部署決策地圖
常見問題
5 到 30 倍這個數字是怎麼來的?
來自 Gartner 2026 年 3 月發布的預測報告。核心原因是 AI Agent 完成一件任務需要多次模型呼叫,每次呼叫都要重讀之前累積的上下文,所以 token 消耗隨任務步數快速累加。不同任務型態差異很大,客服類約在三十倍,軟體開發類的公開量測甚至達到一千倍。
模型單價一直在降,等它再便宜一點不就好了?
單價確實在降,但 Gartner 同時預測每個代理式工作流的推論成本到 2028 年還會上升五倍以上,因為任務會越來越長。等待降價解決不了結構問題,真正有效的是量測、快取治理、批次調度與模型分級路由這些架構層的做法。
我們該先做什麼?
先埋點。在任何優化之前,讓每一次模型呼叫都帶上部門、流程與任務類型的標籤,把總帳單拆回業務線。沒有這一步,所有優化都無法驗證效果,也無法向預算單位說明投資報酬。
如果貴司的 AI 帳單已經出現「單價在降、總額在漲」的曲線,或者正在評估把 AI Agent 接進核心系統,歡迎聯絡品得網絡。品得網絡不推銷模型或平台,先協助貴司把帳單拆開,看清楚錢花在哪裡。
