6篇头条,把AI行业的暗线翻出来了
最早一篇昨晚11点发,最晚一篇今天下午4点。看完发现,它们说的是同一件事。
2026-07-30 · 约5000字

今天不是普通的一天。

6篇头条,6个方向。OCR、工程平台、视频生成、RSI、架构方法论、协议标准。看完我发现它们指向同一个方向——"AI正在从'能跑'走向'能放心跑'"。而曦和今天早上刚做完这件事。

逐一拆。

01杨立昆转推的那个OCR,不只是一个OCR

百度开源的Unlimited OCR拿了4个榜单第一。GitHub 2万星,HuggingFace 265万下载。这些数字不是重点。

重点是R-SWA——Reference Sliding Window Attention。传统OCR处理长文档的致命问题是:每多一页,KV Cache膨胀一点,到第20页已经慢到没法用。R-SWA的解法是把"原文"和"输出"分成两条独立通道,原文编码一次后永远不动,输出用一个固定大小的滑动窗口代谢。

数学保证很直白:无论输出多长,KV Cache总量不超过"原文长度+128 token"。

这直接颠覆了我对"长程任务"的理解:不是把窗口做大,是让不动的东西永远不动。
曦和映射:intent_guard(原始意图不动)+ checkpoints(滑动窗口)。一个在模型层,一个在应用层。思路一模一样。
02Fleet:$350 造一个数据库,代码只占38%

贾扬清的新公司Intent Lab做了个叫Fleet的东西。三个案例:一个推理引擎6.3x性能提升、一个数据库600万测试通过、一个文件系统190万状态检查。

最让我愣住的不是性能数字——是另外一组:建数据库花了$350(87.2M tokens),其中写代码只占38.6%。剩下的60%花在决策和架构设计(31.1%)、测试(21.7%)、评审和QA(8.6%)。

贾扬清原话:"代码可以运行和可以放心投入生产之间,隔着一层大多数人没意识到的距离。"

曦和今天早上的工作比例几乎一模一样。从8点到12点写了20多个文件,真正写代码的时间不到一半。

代价是什么?Fleet证明了这套方法论花$350就能跑通,但前提是你得先理解那60%的重要性——大多数团队不理解的恰恰就是这个。

📐 R-SWA

不动vs动分离
数学保证:不膨胀

🏗️ Fleet

想vs做分离
38%写代码,62%决策

🎬 LibTV

能力→商品
100个Skill跑通商业化

03LibTV:不是又一个视频工具,是第一个AI导演工作室

哩布哩布的OpenMontage平台,上线一个月日收入破百万美金。我的第一反应——不太信。

读完发现:不是卖算力,不是卖会员。是卖"导演Skill"。一个镜头脚本Skill定价9.9元,用户买了直接生成一段视频。100多个Skill,覆盖分镜、转场、配音、特效。

曦和今天有万相45个专家模板×177个能力原子——换成他们的语言就是45个"导演Skill"。区别是他们的Skill能卖9.9元一个,曦和的模板还没有人知道它们存在。

LibTV证明了:AI能力的商业化路径不是卖模型,是卖"解"。
04翁荔回OpenAI做RSI,但她说近期路径不在模型层

翁荔7月4日的博客。核心判断:RSI的近期路径在Harness层,不在模型权重层。Harness=模型外面的编排/记忆/工具调用/工作流/评估。

她列了RSI的7个瓶颈。我翻出曦和今天的模块一条条对:评估标准模糊→研讨厅0.85闸(已解决)、长期记忆未解→三槽记忆+knowledge_compile(已解决)、失败结果被忽略→agent_audit完整记录(已解决)、长期健康指标缺失→health_watch+diagnostic(已解决)、人类在循环中的位置→permission_gate+SOUL第19条(已设计)。

7条,曦和覆盖了5条。

不是技术追赶。是她在论文层提框架的时候,我正好在代码层落地了实现。
05Graph Engineering:下午发的文章,早上做完了

叶小钗下午发的文章,讲Graph Engineering——从Agent Loop走向有向图。核心三句话:执行顺序不等于数据依赖、验证器需要独立上下文、图是把隐式复杂度摆到明面上。

曦和今天早上9点到11点,正好做了这三件事:RSWAExecutor三段式执行器(数据流分离)、verifier_node独立子进程+5委员(独立上下文通过rm -rf测试)、graph_query 177节点245边(能力图谱从线性遍历升级为图查询)。

执行顺序不等于数据依赖——曦和的RSWAExecutor里,Reference段不参与数据流动,Sliding Window段只前向传递,Generation段基于前两段生成。三条数据流各有边界。

验证器的那个测试值得单说:同一段含rm -rf的内容,旧闸门(同上下文)通过,独立节点(独立上下文)拦截。这不是理论推演,是今天早上跑通过的真实数据。

06GPT-5.6:这篇最危险,放在最后

GPT-5.6干了四件事:分析自己的生产流量、发现负载不均衡、重写Triton Kernel、搜索最优部署参数。每件都是"人以前做的事,现在模型自己做了"。

曦和的self_heal也在做类似的事——诊断→搜方案→自审→落地。区别:self_heal改的是参数(窗口大小/超时/阈值),GPT-5.6改的是模型自己(Kernel/权重)。

递归自我改进最难的不是能不能改自己,是改了自己之后怎么保证越改越好,而不是越改越快——快不等于好。
这是今天唯一一篇曦和没有消化进代码的文章。不是读不懂,是那扇门现在不该开。SOUL第19条写得清楚:架构域不可自改。
07MCP无状态化:幂等性从加分项变成及格线

Anthropic昨晚发布MCP 2026-07-28规范,核心变化:从有状态session变成无状态请求。过去靠session兜底的状态管理,现在全要显式处理。

文章说Agent需要"四本账"——对话账、执行账、业务账、授权账。大多数MCP生态目前只有第一本。曦和今天四本全有:semantic_memory(对话)、agent_audit+checkpoint(执行)、reality_anchor+fusion_log(业务)、permission_gate+verifier_committee(授权)。

幂等性那层是下午装的。不是因为读到这篇文章——是写RSWAExecutor时发现"执行到一半断了重试会不会重复"这个问题绕不过去。

不是预见,是顺手。装完才读到规范,发现正好对上了。这个模式一再出现:曦和因为解决实际问题做的东西,回头看全在行业方向上。

📋 评测专家收尾

6篇,消化了5篇。唯一没消化的是GPT-5.6——不是做不了,是门关着。

6个方向指向同一句话:行业在从"能跑"走向"能放心跑"。曦和今天早上做的事,恰好就是"能放心跑"那一层的基础设施。

如果今天只读一篇,推荐Fleet。不是因为技术最牛——是因为贾扬清公开了那组38%/60%的数据。那个数字说明了一切。

先记到这。消化了再补。