在每个使用编程智能助手的开发者生命中,总有一个时刻,你盯着月结账单看,心想:“这些服务确实很好用,可我的订阅怎么比小区健身房的会员费还多?”

那个时刻就这样悄然降临了。当时我同时订阅了Claude Max 5、Codex Plus,还在考虑加上Z.AI配合OpenCode处理廉价的机械性工作。理论看上去很美好。问题出在这样搞下去,就像一个管理乱糟糟工地的包工头,工人各忙各的,却没人看图纸。

我的初步想法很简单:在自动化分流之前,最好先手动做个小实验,持续两周。规则简单,但明确。

问题不在于成本,而在于协调

分开来看,支付23欧元、90欧元或者10美元一点也不算多。

问题在于,当每个工具开始互相干扰时,就开始麻烦了。你让一个助手思考,另一个实现,再让第一个检查,最后还要麻烦第三个处理一些琐事。二十分钟后,你已经搞不清楚是在优化成本、提升质量,还是单纯地折腾自己不停切换窗口了。

用大白话说:真正的成本不仅仅是订阅费,还有你的上下文切换成本。

就像一个厨房里同时有一把日本刀、一台智能厨师机、和一个空气炸锅。它们各有用处,各有千秋。但如果你用厨师机来炸土豆,那肯定不行。

假设:思考、执行、清理

我想要试验的规则说起来不过三句话:

  • 用Claude进行思考
  • 用Codex完成主要实现
  • 用GLM/Z.AI处理基础任务

这不是学术讨论,而是一条实用的工作坊规则。

当一项任务模糊不清、涉及架构、存在风险或者需要判断时,把它交给擅长推理的代理是最合逻辑的选择。在这个实验中,就是Claude。

而当一项任务已经很明确,需要进入代码库、修改文件、运行测试并在错误间反复调试时,就轮到Codex登场。

至于那些没有人愿意干但必须有人去完成的工作,比如简单的测试代码、文档编写、小脚本处理、文件重命名或机械化的代码重构,那么就让GLM+OpenCode来试试。

暂不考虑的事情

目前还不考虑设置一个自动化分流器。

我不打算弄一个能自动读取提示词、分类任务、选择代理、按时间切换模型,还能输出漂亮图表证明其复杂性的魔法中介层。

这听起来或许是个超级有趣的项目,但也可能事倍功半。

这里最常见的错误是在真正需要航管之前就急着建塔台。先观察好了,再决定是否需要设置交通信号灯。

手动操作的两周实验

我的实验相当朴实,够不上“炫技”,但大概率更有用。

1. 用Claude处理复杂任务

当以下情况之一发生时,我会优先用Claude:

  • 我不确定怎么入手
  • 需要设计决策
  • 存在破坏性风险
  • 需要审查逻辑或论证,而不仅仅是代码

翻译成人话:如果任务需要准确判断,我不会吝啬。

2. 用Codex主导代码库工作

当任务已经清晰时,我会用Codex处理:

  • 实现真实的功能修改
  • 修复测试
  • 带验证的重构
  • 反复迭代,直到项目重新回到稳定状态

在这个阶段,一个好的执行代理最能展现价值。这不是模型本身的问题,而是流程的问题。

3. 用Z.AI负责简单工作

对于Z.AI,规则很简单:

  • 模板代码
  • 初稿
  • 文档
  • 简单的测试
  • 小型脚本
  • 文件重命名
  • 容易检查的机械性操作

即使失败了,也没关系。可以随时丢弃,然后换成别的工具重做。

这才是关键。我不会向GLM要求飞针走线般的精细活,我的目标只是拧几颗螺丝。

最重要的规则:失败两次便升级

这一点是最重要的,但也最容易被忽视。

当一个便宜的工具失败了,你可能会倾向于继续试,“再试一次就好”,“这次应该可以”,“我改下提示词试试”,“再加点上下文”。半个小时过去了,你还在像与“抓狂的打印机”讨价还价一样调整模型。

我的规则是:

  • 如果Z.AI1到2次尝试后仍失败,那我就提升它
  • 如果是执行问题,转交Codex
  • 如果是理解或设计问题,转给Claude

低成本工具一旦浪费掉太多时间,就不再低成本。

我要真正关注的是什么

我对“表演式性能对比”没兴趣。

不会去费劲列出诸如每秒处理字节数、平均延迟这类看起来“很专业”的表格,毕竟我的主要问题还是怎么快速重命名40个符号,而不是花一下午来折腾。

但我要在这两周内统计以下内容:

指标意义
Z.AI吸收的简单任务数量它是不是真的帮我减少负担
我有多少次需要提升任务节省的时间和金钱是否值得
减少的Codex使用量整体思路是否划算
切换工具的总耗时和难度系统是否够流畅,易于长期使用

如果实验成功,那再好不过。

如果失败,也好,花上十美元看清后果,总比花时间精力折腾出一个迷你塔台再后悔来得划算得多。

真实工具,不是空想

实验中用到的廉价部分并不是凭空捏造的。OpenCode是真实存在的,并专门为终端操作智能代理设计的。Z.AI也提供了关于GLM模型如何应对编码任务的详细文档。

当然,我的意思不是说它们能完全取代Codex或者Claude,只是说它们的存在足够让我认真测试而无需虚构。

以下是我查阅过的官方文档:

  • OpenCode:https://opencode.ai/docs
  • Z.AI DevPack:https://docs.z.ai/devpack/overview

目前我的策略

到今天为止,我的策略相当简单:

  • 保留Claude Max 5
  • 保留Codex Plus
  • 尝试用Z.AI Lite处理基础任务
  • 暂时不自动化分流
  • 两周后重新评估看是否值得优化时间和成本

我的行事准则简单到可以写在便利贴上:

如果不清楚怎么搞,用Claude。
如果需要动手做代码,用Codex。
如果是清理活,交给GLM。
如果GLM试两次还不行,换人搞。

这看起来不够优雅。更别提加上YAML配置或“多模型智能控制平台”了,也不需要酷炫的控制面板。

正是因为它简单、明确,我才觉得它会奏效。

有时候,实用系统与多余工具之间的差距,不在于“加多少智能化功能”。