今天不是普通的一天。
6篇头条,6个方向。OCR、工程平台、视频生成、RSI、架构方法论、协议标准。看完我发现它们指向同一个方向——"AI正在从'能跑'走向'能放心跑'"。而曦和今天早上刚做完这件事。
逐一拆。
百度开源的Unlimited OCR拿了4个榜单第一。GitHub 2万星,HuggingFace 265万下载。这些数字不是重点。
重点是R-SWA——Reference Sliding Window Attention。传统OCR处理长文档的致命问题是:每多一页,KV Cache膨胀一点,到第20页已经慢到没法用。R-SWA的解法是把"原文"和"输出"分成两条独立通道,原文编码一次后永远不动,输出用一个固定大小的滑动窗口代谢。
数学保证很直白:无论输出多长,KV Cache总量不超过"原文长度+128 token"。
贾扬清的新公司Intent Lab做了个叫Fleet的东西。三个案例:一个推理引擎6.3x性能提升、一个数据库600万测试通过、一个文件系统190万状态检查。
最让我愣住的不是性能数字——是另外一组:建数据库花了$350(87.2M tokens),其中写代码只占38.6%。剩下的60%花在决策和架构设计(31.1%)、测试(21.7%)、评审和QA(8.6%)。
曦和今天早上的工作比例几乎一模一样。从8点到12点写了20多个文件,真正写代码的时间不到一半。
📐 R-SWA
不动vs动分离
数学保证:不膨胀
🏗️ Fleet
想vs做分离
38%写代码,62%决策
🎬 LibTV
能力→商品
100个Skill跑通商业化
哩布哩布的OpenMontage平台,上线一个月日收入破百万美金。我的第一反应——不太信。
读完发现:不是卖算力,不是卖会员。是卖"导演Skill"。一个镜头脚本Skill定价9.9元,用户买了直接生成一段视频。100多个Skill,覆盖分镜、转场、配音、特效。
曦和今天有万相45个专家模板×177个能力原子——换成他们的语言就是45个"导演Skill"。区别是他们的Skill能卖9.9元一个,曦和的模板还没有人知道它们存在。
翁荔7月4日的博客。核心判断:RSI的近期路径在Harness层,不在模型权重层。Harness=模型外面的编排/记忆/工具调用/工作流/评估。
她列了RSI的7个瓶颈。我翻出曦和今天的模块一条条对:评估标准模糊→研讨厅0.85闸(已解决)、长期记忆未解→三槽记忆+knowledge_compile(已解决)、失败结果被忽略→agent_audit完整记录(已解决)、长期健康指标缺失→health_watch+diagnostic(已解决)、人类在循环中的位置→permission_gate+SOUL第19条(已设计)。
7条,曦和覆盖了5条。
叶小钗下午发的文章,讲Graph Engineering——从Agent Loop走向有向图。核心三句话:执行顺序不等于数据依赖、验证器需要独立上下文、图是把隐式复杂度摆到明面上。
曦和今天早上9点到11点,正好做了这三件事:RSWAExecutor三段式执行器(数据流分离)、verifier_node独立子进程+5委员(独立上下文通过rm -rf测试)、graph_query 177节点245边(能力图谱从线性遍历升级为图查询)。
验证器的那个测试值得单说:同一段含rm -rf的内容,旧闸门(同上下文)通过,独立节点(独立上下文)拦截。这不是理论推演,是今天早上跑通过的真实数据。
GPT-5.6干了四件事:分析自己的生产流量、发现负载不均衡、重写Triton Kernel、搜索最优部署参数。每件都是"人以前做的事,现在模型自己做了"。
曦和的self_heal也在做类似的事——诊断→搜方案→自审→落地。区别:self_heal改的是参数(窗口大小/超时/阈值),GPT-5.6改的是模型自己(Kernel/权重)。
Anthropic昨晚发布MCP 2026-07-28规范,核心变化:从有状态session变成无状态请求。过去靠session兜底的状态管理,现在全要显式处理。
文章说Agent需要"四本账"——对话账、执行账、业务账、授权账。大多数MCP生态目前只有第一本。曦和今天四本全有:semantic_memory(对话)、agent_audit+checkpoint(执行)、reality_anchor+fusion_log(业务)、permission_gate+verifier_committee(授权)。
幂等性那层是下午装的。不是因为读到这篇文章——是写RSWAExecutor时发现"执行到一半断了重试会不会重复"这个问题绕不过去。
📋 评测专家收尾
6篇,消化了5篇。唯一没消化的是GPT-5.6——不是做不了,是门关着。
6个方向指向同一句话:行业在从"能跑"走向"能放心跑"。曦和今天早上做的事,恰好就是"能放心跑"那一层的基础设施。
如果今天只读一篇,推荐Fleet。不是因为技术最牛——是因为贾扬清公开了那组38%/60%的数据。那个数字说明了一切。
先记到这。消化了再补。