上个月我们组接手了一个三年没人敢动的 Python 老服务。说没人敢动,是因为上一个碰它的哥们离职前在群里留了句"那玩意儿能跑就别动"。结果它真就不能动了——一个隐藏的时区 bug,只在月底跑批的时候炸,本地怎么测都正常。
我盯着那个报错看了半小时,决定干一件有点轴的事:把这个问题原封不动丢给手头所有的 AI 编程工具,看谁先把它搞定。不为写测评,单纯是想偷懒。
最后我用了 9 个工具,每个都给了同样的报错信息和相关文件。下面是真实发生的事,不是参数表截图。
先说说这 9 个选手
- Cursor:编辑器形态,最出圈的那种,订阅制,背后能切好几个模型。
- GitHub Copilot:老牌插件, VS Code 里 inline 补全起家,现在也能聊天。
- Claude Code:Anthropic 出的命令行 agent,直接在你终端里改文件、跑命令。
- Cline:开源的 VS Code 插件,你自己的 API key,能自己读文件、跑终端。
- Aider:开源,纯终端,专门干"改真实仓库"这件事。
- Windsurf:Codeium 家的,主打一个叫 Cascade 的 agent 流程。
- Codex CLI:OpenAI 出的命令行工具,用你自己的 OpenAI key。
- Gemini CLI:Google 出的,免费额度给得狠,上下文窗口大得离谱。
- Zed:Rust 写的编辑器,后来也接了多 agent 协作。
九个,形态五花八门,价格从免费到每月几百都有。
第一轮:它会不会先读代码,再动手
我给的报错里,真正的锅在一个叫 batch_close() 的函数里,但触发点在另一个文件。这种"隔着文件"的 bug,最考验工具会不会先搞清楚状况。
结果挺打脸的。
Copilot 和最早的 Cursor 默认模式,上来就给了一段修复代码,写得很自信。我粘进去一跑——还是炸。它改的是触发点那个文件,根本没碰真正出问题的 batch_close()。它压根没读那个文件。
Claude Code 和 Cline 不一样。它们第一件事是真的去 grep、去读 batch_close() 的源码,然后把调用链捋给我看,最后才改。Aider 更绝,它让我先 git add 一下,然后它自己根据仓库结构建了一份"地图",再去改,改完还能直接 git diff 给我看。
这一轮我学到的:凡是默认就敢改、不先读上下文的,碰老项目要小心。不是它傻,是它"太自信"。
后来我养成一个习惯:让任何工具改代码之前,先让它用一句话告诉我"我准备改哪个文件、为什么"。说不上来的,我一律不采纳。
第二轮:从零搭一个全栈脚手架
bug 修完,我顺手测了另一个常见活儿:让它生成一个带登录、能存数据的全栈小项目。
这回 Gemini CLI 和 Codex CLI 表现意外地好。Gemini 那个 100 万 token 的上下文不是吹的,我把一整套需求文档贴进去,它能记住前后十几条约束不打架。Codex CLI 生成的 Flask + SQLite 那版,结构干净,连测试都顺手写了。
Cursor 和 Windsurf 在"边聊边改"这件事上最舒服。你看到一半觉得"这页布局不对",直接说,它当场改,编辑器里红绿对比一目了然。Cline 也能做到,但因为它在 VS Code 里,体验跟 Cursor 几乎一个路子。
Zed 这轮稍微吃亏——它的 agent 协作确实强,但脚手架这种"一次出整套"的活儿,它目前还不如专门的工具顺手。
第三轮:50 万行的大仓库里找东西
我们主仓库大概 50 万行。我让它干一件真实的活:把所有调用了废弃 API legacy_auth() 的地方列出来,并给出替换方案。
这轮 Cline 和 Claude Code 完胜。它们能真的在终端里跑 grep、读多个文件、跨文件改,不会"读到一半忘了前面"。Copilot 在这种大仓库里开始吃力,补全经常对不上当前文件的上下文,聊天模式又因为上下文限制,列不全。
Aider 这轮是性价比之王。开源、免费(用你自己的 key),仓库地图机制让它在超大项目里定位极准,就是交互偏极客,没界面的那种爽感。
第四轮:不能传云的代码
有些代码有合规要求,不能往外发。这轮只有两条路:本地能跑的开源方案,或者自带密钥、数据不出本机的方案。
Cline、Aider、Codex CLI、Gemini CLI 都是开源,代码和请求都在你机器上,你用自己的 key,理论上请求发到哪家模型厂商看你自己的配置。Cursor、Copilot、Windsurf 走的是它们自己的云服务,代码摘要会过它们的服务端(各家都有"不拿训练"的声明,但物理上确实出过本机)。
合规敏感的场景,我一般直接用 Cline 接本地模型,或者 Aider 配一个私有部署的端点。
价格与能力对照
下面这表是我实测下来,结合公开定价整理的。价格会变动,看着个大概就行。
| 工具 | 形态 | 月费(约) | 上下文 | 自主改文件 | 适合谁 | aibounty 评分 |
|---|---|---|---|---|---|---|
| Cursor | 编辑器 | $20 起 | 中 | 中 | 想边聊边改的普通人 | 92 (S) |
| Copilot | 插件 | $10 起 | 中 | 弱 | 已经在用 VS Code 的 | — |
| Claude Code | 终端 agent | 含 Claude 订阅 | 大 | 强 | 敢把终端交给 AI 的老手 | 87 (A) |
| Cline | 开源插件 | 免费+自身 key | 大 | 强 | 想控成本又要多功能 | 85 (A) |
| Aider | 开源终端 | 免费+自身 key | 大 | 强 | 极客/大仓库 | 83 (A) |
| Windsurf | 编辑器 | $15 起 | 中 | 中 | 喜欢 agent 流程的 | 84 (A) |
| Codex CLI | 开源终端 | 免费+OpenAI key | 大 | 强 | OpenAI 生态用户 | 79 (B) |
| Gemini CLI | 开源终端 | 免费档很大 | 极大 | 强 | 长文档/大上下文任务 | 78 (B) |
| Zed | 编辑器 | 免费起 | 中 | 中 | 追求速度和多 agent | 76 (B) |
我的结论,不绕弯子
没有"最强"的那个。这九个别看都是 AI 编程,干的活完全不一样:
- 你是 everyday 写业务代码的普通人,要的是顺手、能聊、改完看得见——Cursor 或 Windsurf,闭眼选。
- 你敢把终端交给 AI、让它自己跑命令自己改——Claude Code 和 Cline 是真香,后者还免费。
- 你仓库大到离谱、或者合规不允许出本机——Aider + 你自己的 key,或者 Cline 接本地模型。
- 你天天跟长文档、大需求打交道——Gemini CLI 那个上下文,省心。
我自己的日常搭配是:写业务用 Cursor,改老仓库和跑批任务用 Claude Code,合规代码用 Cline 接本地模型。三个换着用,谁也替代不了谁。
有个真相得说:工具再强,也救不了"你自己不知道要什么"的情况。我见过最惨的,是把一句"帮我优化一下性能"扔给 agent,它就真敢给你重写一半代码。所以最值钱的技能不是会用哪个工具,是你能不能把问题说清楚。
这一类工具我们每天在 [AIbounty](/) 上都会从 GitHub、Hacker News、Product Hunt 这些地方扒新的进来。上面这九个,加上一堆还没出圈的,库里现在两千六百多个,随便翻。
评分说明:上表「aibounty 编辑评分」为站内编辑自有评分(5 维各 0-20 分、合计 0-100:成熟度 / 生态 / 能力 / 独特性 / 国内可达),独立于 GitHub 星标,反映我们对工具实际定位的判断,仅供横向参考。