技能学习
Sep 28, 2026

调用 Token 怎样节省开支?GLM-5.3-Flash、Z.AI Coding Plan 与 Hermes 免费层级全拆解

核心结论:AI 调用成本高,往往不是因为你用得多,而是钱花错了地方:输出 token 按 3–10 倍于输入的价格计费、缓存不命中、按量付费没有账单上限。本文给出三条经过核实的省钱路线——① 把常规任务换到 GLM-5.3-Flash(输出 $0.50/1M,约为旗舰 GLM-5.3 的 1/9);② 高频编程用 Z.AI Coding Plan 包月封顶(官方口径最高省 92%,配额耗尽不扣余额);③ 用 Hermes Agent 免费层级把一类业务(如站内客服)的边际成本直接归零,并附上我们站内已跑通的真实案例。

一、先看清:AI 调用成本到底花在哪?

一份 Token 账单通常由三部分构成,而它们的单价差异极大:

计费项典型单价关系省钱杠杆
输入 token基准价精简提示词、剪掉冗余上下文
缓存命中输入约为标准输入的 1/5固定前缀,提高缓存命中率
输出 token常为输入的 3–10 倍控制输出长度,重任务分流到低价模型

以 GLM 系列为例:旗舰 GLM-5.3 输入 $1.4/1M、输出 $4.4/1M,输出是输入的 3 倍多;而缓存命中输入只要 $0.26/1M。这意味着同样一次调用,「缓存是否命中」和「输出了多少字」对账单的影响,往往比换一家供应商还大。省钱的优先级应该是:先压输出和缓存,再谈套餐,最后用零成本方案兜底。

二、路线一:换用极低价的模型 —— GLM-5.3-Flash

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,官方定位为「专攻可视化编程的多模态编程模型」。工程上是 320B 总参数、18B 激活的稀疏架构:相较旗舰 GLM-5.3,注意力计算降低 3.01 倍、KV cache 降低 4.44 倍——省下的算力直接反映在价格上。

2.1 价格:输出价约为旗舰的 1/9

模型输入 /1M缓存输入 /1M输出 /1M
GLM-5.3-Flash$0.15$0.03$0.50
GLM-5.3-FlashX(加速版,200 tokens/s)$0.37$0.075$1.25
GLM-5.3(旗舰)$1.4$0.26$4.4

三个数字值得记住:输出 $0.50/1M 约为旗舰的 1/9;缓存命中输入 $0.03/1M 只有标准输入的 1/5;缓存存储限时免费(以官方定价页为准)。

2.2 能力与适用场景

价格低不代表能力缩水。GLM-5.3-Flash 提供 1M tokens 上下文窗口和 128K 最大输出,支持视频/图片/文本/文件输入、思考模式、流式输出、函数调用与上下文缓存。适用场景包括:

  • 可视化与前端编程、游戏与 3D(Blender)场景;
  • GUI 与浏览器自动化操作;
  • Office 文档产出(PPTX/PDF/DOCX/XLSX);
  • 金融研究、长文档处理等大规模上下文任务。

一个务实的分流策略:日常草稿、批量处理、长文档摘要交给 Flash;关键决策与复杂架构仍用旗舰把关。另外,Z.AI 侧还有完全免费的 GLM-4.7-Flash、GLM-4.5-Flash、GLM-4.6V-Flash,适合零成本试验场景。

三、路线二:用包月套餐替代按量付费 —— Z.AI Coding Plan

如果你的调用是高频、可预期的编程场景,按量付费就像没有套餐的手机话费。Z.AI Coding Plan 的思路是包月封顶:一次订阅解锁一整套 Agent 工具额度,官方口号是「用一个套餐替代多个工具订阅」。

3.1 三档额度与价格

档位5 小时额度每周额度挂牌月费年付约定位
Lite2,00010,000$18$12.6/月小仓库轻量迭代
Pro12,00060,000$80$56/月中仓库日常开发
Max28,000140,000$168$117.6/月中大型仓库重度使用

注意区分两种口径:$18/$80/$168 是挂牌月费;订阅页默认展示的 $12.6/$56/$117.6 是年付 7 折折算价(季付 8 折)。所有档位均可调用 GLM-5.3 与 GLM-5.3-Flash(其中 Flash 享 3 倍额度;FlashX 加速版暂未上线套餐),并支持 ZCode、AutoClaw、Claude Code、Codex、Cline、Cursor、OpenCode 等 20 多个工具,附赠视觉理解、Web Search、Web Reader、Zread 四个 MCP 工具。

3.2 省钱机制:为什么最多能省 92%

Coding Plan 的额度按倍率折算:额度 =(输入×输入倍率 + 缓存输入×缓存倍率 + 输出×输出倍率)÷ 10000。两个模型的倍率不同:

计费项输入倍率缓存输入倍率输出倍率
GLM-5.36.91.724
GLM-5.3-Flash2.30.568

官方给出的省钱逻辑有三层:

  1. 非高峰 5 折:高峰时段为周一至周五 14:00–18:00(UTC+8),其余时间按标准额度的一半计费;
  2. 账单封顶:配额用尽后,工具体内不会扣账户余额,等下一个 5 小时周期刷新即可——按量付费最怕的「意外账单」在这里不存在;
  3. 官方口径:充分利用非高峰折扣,相比按量调用 GLM-5.3 标准 API,最高可省 92%。

限时活动(以官方页面为准):2026-09-25 至 10-07 全天按非高峰 5 折计费;2026-09-03 至 10-07 每日 23:00–次日 09:00,付费用户经 ZCode / AutoClaw 使用 GLM-5.3-Flash 不限量,其他 Agent 额度加倍。团队协作可选 Team Plan(最少 2 席),超额部分按 API 挂牌价 9 折计费,默认不用于训练。两点提醒:订阅不可退款,取消需在下次扣费前 24 小时操作。

四、路线三:把一类业务成本直接归零 —— Hermes Agent 免费层级

前两条路线是「把单价压低」,第三条路线更彻底:让一类业务的模型调用直接免费。Hermes Agent 由 Nous Research 提供,模型与工具额度走 Nous Portal 订阅,其中 Free 档完全免费:

档位价格月度额度模型范围限速
Free$0$0 credits仅免费模型标准限速
Plus$20/月$22 credits200+ 模型高限速
Super$100/月$110 credits200+ 模型高限速
Ultra$200/月$220 credits200+ 模型高限速

免费档可用的模型包括 inclusionAI Ling 3.0 Flash、Meituan LongCat 2.0/2.5 Preview、Poolside Laguna、StepFun Step 3.7 Flash、Upstage Solar Pro 4 等($0.00/1M)。网页搜索由 Perplexity Fast Search 提供,对所有档位免费。

必须说清边界:免费档是「仅免费模型 + 标准限速 + 无月度 credits」,不是不限量。请求次数和并发量都有约束,适合客服问答、文本理解等基础场景;业务量上来后要评估升级。

4.1 开通流程

hermes setup            # 1. 命令行初始化
# 2. 选择 quick setup(仅全新安装时出现)
# 3. 打开授权链接,用 Gmail 一键登录
# 4. 套餐选 free plan(需绑卡,但费用为 0)
hermes setup --portal   # 重走 OAuth / 更换 provider / 开 Tool Gateway
hermes auth logout nous # 想彻底重来先登出

完整图文流程见站内教程:如何免费使用 Hermes agent(Nous 免费订阅开通全流程)。绑卡环节建议使用虚拟信用卡,免费开卡教程见 虚拟信用卡免费开卡教程。

五、落地案例:免费 AI 智能客服,24h×7 零边际成本

免费层级听起来抽象,我们站内已经跑通了一个完整案例:如何给网站配置免费的 AI 智能客服——24h×7 业务助手。核心是三步:

受限子用户 ──► Hermes Agent + Service API ──► Nous 免费订阅 ──► 集成站内客服
(权限隔离)    (绑定子域名/API Key/模型ID)   (免费模型+免费搜索)  (对话接入/业务联动)
  1. 搭建底座:创建受限子用户,部署 Hermes Agent 并启用 Service API,绑定子域名、API Key 和模型 ID;
  2. 接入免费模型:通过 Wizard 授权登录 Nous,启用免费订阅,全部调用走免费模型;
  3. 集成业务:用开源复合业务系统接入对话,并联动业务数据。

这个案例最有价值的启示是:省钱不只是压单价,而是重新划分「哪些业务值得花钱」。客服问答这类高频低难度任务,用免费模型就能覆盖大部分流量;真正需要强度的开发任务,再交给 GLM-5.3-Flash 或 Coding Plan。原文有一句关键提醒:免费模型通常带有使用限制(如请求次数、并发量),请根据业务量合理规划——建议提前做好限流与人工兜底。子用户与 Service API 的详细配置见 Hermes Agent 子用户与 Service API 配置,业务系统选型见 开源复合业务系统。

六、决策清单:你该选哪条路?

你的场景推荐方案理由
偶发轻任务、批量文本处理GLM-5.3-Flash 按量输出 $0.50/1M,成本几乎无感
高频编程、日常开发Z.AI Coding Plan包月封顶 + 非高峰 5 折,最高省 92%
站内客服、FAQ 问答Hermes 免费层级免费模型 + 免费搜索,边际成本归零
团队协作、多人开发Coding Plan 团队档席位管理 + 用量看板 + 超额 9 折

三条路线并不互斥,成熟打法是组合:GLM-5.3-Flash 打底常规调用,Coding Plan 封顶高频编程,Hermes 免费档兜住零成本业务。

七、结语与行动清单

Token 开支的下降,从来不只靠某个「便宜模型」,而是计费结构上的三次优化:先让缓存命中、压短输出;再把可预期的重度使用装进包月套餐;最后把低难度高频业务交给免费层级。对照下面的清单,本周就可以开始:

  1. 先开 Hermes 免费档试跑,把客服/问答类流量迁过去;
  2. 查看调用日志,把重任务挪到非高峰时段(避开 14:00–18:00);
  3. 固定提示词前缀,提高缓存命中率;
  4. 高频编程切换到 Coding Plan,享受账单封顶;
  5. 限时活动 2026-10-07 截止,价格以官方页面为准。

省钱的本质不是「用更差的模型」,而是「让每一类任务都落到它应得的价位上」。

参考链接

评论区

0 条评论 · 评论需审核通过后显示

加载评论中...

发表评论

0/2000

← 返回
🔍
客服图标
微信客服图标
🤖
×

微信客服

微信二维码