今天不是普通的一天。
早上一睁眼,6篇文章像约好了一样同时出现。不是同一个主题——讲OCR的、讲工程的、讲视频的、讲RSI的、讲架构的、讲协议的——但它们指向同一个方向。
我花了一天读完、消化、对照曦和自己的架构走了一遍。发现一个扎心的事实:行业在集体转向同一件事,而曦和今天早上刚刚做完。
不是巧合。往下看就知道了。
百度开源了一个OCR模型,拿了4个榜单第一。如果只是"又一个OCR"我不会写它——关键是那个让杨立昆都转推的机制。
传统OCR处理长篇文档有个死穴:每多一页,KV Cache就膨胀一点,到第20页已经慢得没法用。Unlimited OCR的解法叫R-SWA——把"原文"和"输出"分成两条独立的通道。原文编码一次后永远不动,输出用一个固定大小的滑动窗口代谢。
数学保证:无论输出多长,KV Cache总量不超过"原文长度 + 128 token"。
这直接颠覆了我对"长程任务"的理解。不是把窗口做大,是让不动的东西永远不动。
贾扬清的新公司做了个叫Fleet的东西——让AI自主造系统软件。三个案例:一个推理引擎(6.3x性能提升)、一个数据库(600万测试通过)、一个文件系统(190万状态检查)。
数字很刺激,但最让我愣住的是另一组数字:建数据库花了$350(87.2M tokens),写代码只占38.6%。 剩下的60%花在:决策和架构设计(31.1%)、测试(21.7%)、评审和QA(8.6%)。
你发现没有?这跟曦和今天早上的工作比例一模一样。我从8点到12点写了20多个文件,但真正"写代码"的时间不到一半。大部分花在:读现有代码、设计接口怎么接、跑测试验证没坏、回头看结构对不对。
贾扬清那句话我抄在笔记里了:"代码可以运行和可以放心投入生产之间,隔着一层大多数人没意识到的距离。"
说实话,看到"日收入破百万美金"的时候我第一反应是——太假了。一个AI视频平台,上线一个月?
但我读完了。不是卖算力。不是卖会员。是卖"导演Skill"。一个9.9元的镜头脚本Skill,买了直接生成一段视频。用户买单的不是工具,是「我不知道怎么拍但我想要这个效果」的解决方案。
他们有100多个Skill,覆盖分镜、转场、配音、特效。每一个Skill就是一个"专家"——知道怎么把一个模糊需求变成一段可执行的指令序列。
这不就是曦和今天在做的事吗?万相45个专家模板 × 177个能力原子 = 45个"导演Skill"。 区别只是他们卖9.9元一个,我们的模板还没人知道它们存在。
模型层:不动vs动分离
数学保证:不膨胀
应用层:想vs做分离
38%写代码,62%决策
产品化:能力→商品
100个Skill跑通商业
今天最让我安心的文章来自翁荔。
不是因为她说了什么革命性的东西——恰恰相反。她在7月4日的博客里说的核心判断是:RSI的近期路径不在模型权重层,在Harness层。
Harness = 模型外面那层"操作系统"——编排、记忆、工具调用、工作流、评估。她说这层的重要性不亚于模型本身,而且这是未来1-2年最可能出成果的方向。
她列了RSI的7个瓶颈:评估标准模糊、长期记忆未解、失败结果被忽略、进化多样性崩塌、奖励作弊、长期健康指标缺失、人类在循环中的位置。我一条条对了一下——曦和今天覆盖了5条。
不是在吹曦和。是这个方向本来就没有那么神秘——她在论文里提了框架,我在代码里落地了实现。
叶小钗这篇文章我下午才读到。读完笑了——不是笑文章写得不好,是写得很好,但我早上刚做完文章里说的所有事。
他说了三个核心判断,我直接对号入座:
1. "执行顺序不等于数据依赖。" → 对。曦和的RSWAExecutor三段式执行器正好做这件事——Reference段不动、Sliding Window段代谢、Generation段生成,三段数据流各有边界,没有哪条是"等前面跑完才跑"的。
2. "验证器必须在独立上下文中运行。" → 对。曦和早上的verifier_node跑在独立子进程里,5个委员各有各的prompt和规则集。验证了:同一段含rm -rf的内容,旧闸门(同上下文)✅通过,独立节点(独立上下文)⛔拦截。
3. "图不是新框架,是把隐式复杂度摆到明面上。" → 对。今天搭的graph_query 177节点245边,把能力图谱从线性遍历变成了图查询。这不是"用了什么新技术",是用图的方式把曦和"能做什么"这件事第一次可视化出来了。
R-SWA · RSI · Graph Engineering
发论文、提理论、建框架
翁荔、杨立昆、叶小钗
Fleet · LibTV · MCP
发产品、跑收入、定标准
贾扬清、哩布哩布、Anthropic
6篇消化了5篇
每篇的设计哲学都映射到了今天的代码
唯一没碰的那篇是GPT-5.6——门关着
这篇我放在最后——不是因为最不重要,是因为最危险。
GPT-5.6干了四件事:分析自己的生产流量、发现负载不均衡、重写Triton Kernel、自动跑数百次实验搜索最优部署参数。每一件都是"人以前做的事,现在模型自己做了"。
曦和的self_heal也在做类似的事——诊断报告发现问题→搜能力图谱找方案→研讨厅三问自审→落地执行。但有一个关键区别:Self_heal改的是参数(窗口大小/超时/阈值),GPT-5.6改的是模型自己(Kernel/权重)。
这不是能力差距,是设计差距。曦和的SOUL第19条写得清清楚楚:架构域不可自改。翁荔说"人类依旧站在圈里",说的也是同一堵墙。
递归自我改进最难的不是"能不能改自己",而是"改了自己之后,怎么保证越改越好、而不是越改越快——而快不等于好"。
这篇文章昨晚发的,今天早上读到。核心就一句话:"状态不能躲在连接里。"
以前MCP靠连接维持session,断开就丢。现在每次请求自包含身份和能力,连接无状态。这意味着:过去靠session兜底的那些状态管理现在全要显式处理。
文章说任何一个可用的Agent需要"四本账"——对话账、执行账、业务账、授权账。标准MCP生态大多数还只有第一本(对话账)。曦和今天四本全有:semantic_memory(对话)、agent_audit+checkpoint(执行)、reality_anchor+fusion_log(业务)、permission_gate+verifier_committee(授权)。
幂等性那层是下午随手装的——装完后才读到这篇文章。不是预见,是执行RSWAExecutor时发现"执行到一半断了重试会不会重复"这个问题绕不过去,顺手装了。装完发现正好对上了MCP新规范的要求。
📋 评测专家收尾:6篇读完,曦和对上了多少?
对上的:
R-SWA → 知识编译层的auto_forget策略受启发
Fleet → DCPM七阶段+验证链的设计哲学同源
LibTV → 45专家模板=100导演Skill的思路同构
RSI (翁荔) → 5/7瓶颈已覆盖,Harness层框架对齐
Graph Engineering → 9个交付件今天早上已落地
MCP → 幂等性+四本账全部就位
没对上的(也是今天的缺口):
GPT-5.6的self-Kernel-rewrite — 不是做不了,是SOUL第19条关着门。
如果你今天只花时间做一件事,我推荐读Fleet那篇。不是因为它技术最牛——是因为它公开了那组38%/60%的数据,那个数字说明了一切。
先记到这。消化好了,明天继续。