去年这时候,我们想给客服系统接一个能查订单、能改地址的 AI 助手。我第一反应是:上 LangChain。
然后我就陷进去了。不是 LangChain 不好,是它太全了——全到我不知道从哪下手。文档翻了三天,示例跑起来一个,一改需求就报错。最后那个助手是用 Dify 拖出来的,两天上线,跑到现在。
我把这段经历讲给一个做技术的朋友听,他说了句我记到现在的话:选 Agent 框架,看的不是谁最厉害,是你能不能在一个下午把它跑起来。
下面这十个,我大部分都真上手用过。我尽量不说虚的,直接按"你会遇到什么需求"来讲。
先给结论,省得你往下划
- 你只是想把重复的活儿自动化(比如每天抓数据、发报告):n8n,别写代码。
- 公司要搭一个能问答、有界面的内部知识库:Dify,拖拽搞定。
- 你是工程师,要把 agent 嵌进现有 Python 服务:Pydantic AI 或 Agno,类型安全,好维护。
- 你要搞多 Agent 互相吵架、分工干复杂任务:AutoGen 或 CrewAI。
- 你的核心需求是"让模型读懂我的文档然后回答":LlamaIndex,配不配 LangChain 看你心情。
LangChain 不是没位置,它适合"我就是要底层控制、愿意花时间学"的团队。但对大多数人,它是杀鸡用牛刀。
第一类:你只是想自动化点重复活
我司运营每天要干一件蠢事:从三个后台导出 CSV,拼成一个表,发到群里。纯手工,二十分钟,还经常错。
这种需求,上任何"框架"都是浪费。n8n 一个可视化工作流就解决了。节点一拖,HTTP 请求一接,定时触发器一设,跑。它现在也接了 AI 节点,你能在流程里插一个"总结这一段"或者"分类这批邮件"。
n8n 是开源的,能自己部署,节点生态大到离谱。我那个 CSV 拼接,从想法到上线,一个午休时间。
真事:我一开始想用 Python 脚本写,写了半小时还在调 requests 的超时。换成 n8n 拖了六七个节点,十分钟搞定。有些战斗不值得打。
第二类:公司内部知识库问答
这个场景太常见了:把公司文档喂进去,员工用自然语言问"年假怎么请""上个版本改了啥"。
Dify 在这里几乎是降维打击。它有完整的前端界面,你上传文档、配个模型、设好权限,一个能用的问答机器人就出来了。还能接企业微信、飞书。我们那个客服助手就是它干的。
它背后其实也是 LangChain / LlamaIndex 那套 RAG 逻辑,但 Dify 把"部署、界面、权限、日志"这些工程活全包了。你付出的代价是:灵活性不如自己写,深度定制会撞到它的边界。
如果 Dify 的功能边界不够你折腾,LlamaIndex 就是那个底层。它专门解决"怎么把你的数据喂给模型"这件事——索引、检索、重排,都是它的强项。我一般会 LlamaIndex 管数据,再决定要不要套 LangChain 编排流程。
第三类:你是工程师,要写进代码里
我有个同事做交易风控,需要在 Python 服务里嵌一小段 agent 逻辑:读行情、判断异常、调接口告警。这种不能拖拽,得写代码。
他最后选了 Pydantic AI。理由很工程师:它用 Pydantic 做类型校验,agent 输出的结构你能框死,IDE 补全友好,调试不抓瞎。对于本来就在写类型化 Python 的团队,它比"什么都能塞"的框架顺手太多。
Agno(早叫 Phidata)也走这条路线,更偏"多 agent + 记忆 + 知识库"一体,写起来轻。我们另一个小项目用它,几行就能拉起一个带长期记忆的 agent。
这两个的共同点是:不跟你绕弯子,代码即一切,适合能写、也愿意维护的人。
第四类:多 Agent 分工干复杂活
这是 2025 年最火的方向。一个 agent 当项目经理,一个当写手,一个当审稿人,互相丢活儿。
AutoGen(微软出品)是这块的开山祖。它用"对话"来驱动多个 agent 协作,你能看到它们真的在群里讨论问题。适合研究型和复杂编排。
CrewAI 走的是"角色扮演"路线:你定义一组有岗位的角色(研究员、写手、审稿),它们按流程协作。它不依赖 LangChain,独立运行,部署比 AutoGen 轻,社区也猛。
我个人的体会:多 agent 听着酷,但"协作"本身有成本。每次多一个 agent,debug 的难度是指数涨的。除非任务真的复杂到单 agent 理不清,否则别上。
我见过最离谱的,是一个本来一个 prompt 能解决的分类任务,被人套了四个 agent 来做。跑一次烧三倍的 token,还经常三个 agent 吵不出结果。复杂是为了解决问题,不是为了显得高级。
横向对照:十个性格各不同
下面是公开数据和我的体感整理的对照。星数是 GitHub 上的量级(会涨),价格看官方。
| 框架 | 类型 | aibounty 编辑评分 | 上手难度 | 适合 |
|---|---|---|---|---|
| LangChain | 全栈编排库 | 88 (A) | 高 | 要底层控制的团队 |
| LlamaIndex | RAG/索引 | 86 (A) | 中 | 文档问答为核心 |
| AutoGen | 多 agent 对话 | 84 (A) | 中高 | 研究/复杂协作 |
| CrewAI | 角色化多 agent | 82 (A) | 中 | 流程化多 agent |
| Dify | 低代码平台 | 93 (S) | 低 | 内部工具/问答 |
| n8n | 可视化工作流 | 85 (A) | 低 | 自动化重复活 |
| Pydantic AI | 类型安全库 | 78 (B) | 中 | 嵌进 Python 服务 |
| Agno | 轻量多 agent | 75 (B) | 中 | 带记忆的小 agent |
| Semantic Kernel | 微软企业栈 | 78 (B) | 中 | .NET/Java 企业 |
| Smolagents | 极简 agent | — | 低 | 想看 agent 本质 |
我给你的一张决策图
要是你懒得看上面那堆,照这个走:
- 不想写代码、只是自动化 → n8n
- 要个能用的内部问答/助手、最好有界面 → Dify
- 要读文档回答、Dify 不够 → LlamaIndex
- 写 Python 服务、要可控可维护 → Pydantic AI / Agno
- 真要多个 AI 分工 → CrewAI(好部署)或 AutoGen(强编排)
- 以上都不够你造 → LangChain,但先想清楚你到底要它哪一块
别一上来就 LangChain。我那个三天没跑通的教训,希望你看完省下来。
这些框架我们每天都在 [AIbounty](/) 上跟进新版本和替代品。光 agent 这个分类里现在就三百多个,从大厂出品到个人项目都有,挑花眼的时候去翻翻,比看官网文档能少踩不少坑。
评分说明:上表「aibounty 编辑评分」为站内编辑自有评分(5 维各 0-20 分、合计 0-100:成熟度 / 生态 / 能力 / 独特性 / 国内可达),独立于 GitHub 星标,反映我们对工具实际定位的判断,仅供横向参考。