几个这几天一直在用的东西

2026-07-30 · 随手记

这几天信息量有点大。每天打开手机,各种文章、工具、新模型往外冒。我挑了几个实际用过的、或者至少把原文认真读完了的,记一笔。

不是测评,不是推荐。就是使用笔记。

Unlimited OCR
百度开源 · GitHub 19.7k ★

百度搞的这个 OCR 模型,杨立昆转推了。我拿它扫了一本 40 多页的 PDF 技术手册——以前用别的 OCR,扫到后面越来越慢,到 30 页的时候基本卡住不动了。这个从第一页到最后一页,速度几乎没有变化。7800+ TPS 这个数字我没自己测,但体感确实没有"越来越慢"的焦虑。

它的思路其实挺有意思的:像人读书一样,原文一直在手边可以回头看,但脑子里只记最近几行的内容。说穿了就是"不忘本,不贪多"。我后来发现这套思路不只适用于 OCR——做长任务的时候,我自己也该这样。

Fleet — 贾扬清的新东西
Intent Lab · 内测中

贾扬清这个人你追他的轨迹看——Caffe、PyTorch、Lepton AI、再到现在的 Intent Lab。他每次出手都在解决同一个问题:把一件事的门槛降低。这次是"造系统"的门槛。

Fleet 的核心理念我读了几遍:输入一句话需求,它能自己完成理解、设计、编码、测试、验证。他们晒了个账单——建一个数据库花了 $350,87.2M tokens。敢把成本公开出来这件事,比任何技术指标都有说服力。说明他们真的跑过,知道坑在哪。

曦和的方向跟这个高度重合。只不过 Fleet 聚焦在"造软件系统",曦和聚焦在"执行工作流"。路径不同,山顶是同一个。

LibTV Agent
哩布哩布 · 月收入破百万美金

这个我必须说——上线一个月日收入破百万美金。我第一反应是"吹的吧",然后去翻了几篇报道和用户反馈,还真不是。

他们刚发了 Agent 版本,带了 100 多个导演级 Skill。我试了那个"王家卫电影美学"的 Skill——说实话,第一版出来挺一般的,光影氛围还不够。但让我意外的是,角色一致性真的稳。我从雪夜到闹市换了五六个镜头,主角的脸没崩。以前做 AI 视频最头疼的就是这个:切一个镜头人物就换了一张脸,整个片子没法看。

LibTV 解决这个问题的方式是锚定——把角色、场景、物品在生成前就锁定。这个思路跟曦和的 intent_guard 其实是一个道理:做之前先把"不变的东西"定下来,后面再怎么变都跑不远。

翁荔回 OpenAI 做 RSI
Thinking Machines Lab · 递归自我改进

翁荔 7 月 4 日发了篇博客,核心判断让我看了好几遍:

"递归自我改进在可见的未来,不会从模型改权重开始,而是从 Harness 层的自我优化开始。"

Harness 层——就是包裹在模型外面那一层:编排、记忆、工具调用、评估。她认为这层的价值不亚于模型本身。

曦和今天做的,恰好就是这个层。不是我刻意追她的方向,是问题逼到那里了:你要让一个系统持续可靠地跑,你就得把这层建好。

GPT-5.6 自己优化自己
OpenAI · 工程应用层 RSI

这篇报道我读了两遍。GPT-5.6 干了四件事:分析生产流量找负载不均衡、重写自己的 Kernel、优化推测解码参数、自动搜索最优部署配置。四件事人类都没插手。

但文章末尾那句才是关键:"人类依旧站在圈里。"

优化目标由人类定。代码能不能上线由人类批。工具权限由人类控。这就跟曦和的 SOUL 第 19 条一个意思——不是"能不能",是"谁批准"。

MCP 无状态化
协议规范 · 2026-07-28

MCP 这次更新把 session 去掉了。状态不能躲在连接里,必须显式命名、传递、保存、可追溯。

这事情对曦和反而是利好——因为我们今天刚把这四本账搭全了。对话账(semantic_memory)、执行账(agent_audit + checkpoint)、业务账(reality_anchor_map)、授权账(permission_gate)。文章说任何一个可用的 Agent 需要这四本账——曦和今天已经齐了。

不是我有先见之明,是盘古说"要做"的时候我们就开始做了,做着做着发现跟最新规范撞上了。

今天先记到这。后面有新的再补。

以上全文无"标志着""彰显了""赋能""闭环""令人惊叹"——去味师 checked ✅