← 返回往期亮点

2026.08.26 · DAILY LETTER

5小时限制回归、DevDay预告、eval的辨别力、agent时代的系统记录

OpenAI Plus 5小时限制;DevDay 2026预告;eval辨别力;Rauch 的1ms reset;agent 时代系统记录与 ZDR。

早上好,今天是 2026 年 8 月 26 日。OpenAI 对 Plus 套餐重新启用 5 小时限制,DevDay 2026 放出豪言,两位 CEO 对 agent 时代基础设施有不同看法。

我们挑了几条会影响你决策和判断的。

今日要闻

OpenAI Plus 账户重新引入 5 小时使用限制

OpenAI 的 Codex 与 ChatGPT 负责人 Thibault Sottiaux 在 X 上宣布,从 8 月 25 日起,Plus 账户在 ChatGPT Work 和 Codex 中恢复每周 5 小时的使用限制。他解释这是为了平滑计算负载,并指出 Plus 用户相对偏休闲或新手,容易在无意中消耗完一周额度,导致体验不佳。Pro($100 和 $200 订阅)在接下来几个月不受此限制。

编辑观察:这个限制把“计算资源”当作一种昂贵库存来管理。Plus 用户的典型画像被定义为“休闲+新手”,这对产品定位是个信号:Plus 不再是重度用户的选择。如果你在做面向 Plus 层的产品,要预期用户更频繁遇到额度耗尽,这会影响你的支持流程和用户教育。Pro 层不受限,意味着 OpenAI 在拉大分层,值得关注后续定价变化。

OpenAI DevDay 2026 预告:号称史上最佳

同一位高管 Thibault Sottiaux 在 X 上表示,OpenAI DevDay 2026 将是公司历史上最好的 DevDay,并且“不会接近”。这个预告没有任何细节,但来自直接负责 Codex 和 ChatGPT 的高管。

编辑观察:没有细节的预告很难评估,但值得提醒:如果你在规划依赖 OpenAI API 的产品,DevDay 通常伴随新模型或新 API 发布。不要为了等待未知而停滞,但可以预留一点架构上的灵活性,以应对可能的重大更新。

Vercel CEO 发现 reset 命令慢 1000 倍的原因,用 Zig 重写了一个 1ms 版本

Guillermo Rauch 在 X 上分享:当终端进入“坏状态”(如乱码输出)时,通常运行 `reset` 命令。他发现这命令异常慢,追查发现 1979 年 3BSD 的 `tset` 中有一个 `sleep(1)`,目的是让机械打印机和墨水终端“稳定下来”。他用 Zig 写了一个更快的替代品,耗时 1ms 而不是 1s。他说这也是一个探索 `ncurses`、`tset`、`terminfo` 和终端各种“被诅咒”状态的机会。

编辑观察:这是一个系统设计“蜘蛛网”的绝佳例子。终端 reset 命令带着 1979 年的睡眠直到今天,而一位 CEO 愿意为此写一个新的实现。对产品人来说,这提醒我们:有时性能问题不是新问题,而是历史遗留的坏设计。重新审视你产品里的“老逻辑”,可能有意想不到的优化空间。

Box CEO:agent 时代,系统记录比以往更重要

Aaron Levie 在 X 上表示,在一个 AI agent 将在这些系统上做比人类多 100 倍工作的世界里,记录系统(systems of record)从未如此重要。Agent 会查询数据、处理任务、执行工作流、与人类和 agent 协作,因此治理、可靠性、安全性、访问控制和业务逻辑比以往任何时候都关键。他提到 OpenAI Hugging Face 事件只是未来 agent 运行时的一个小窥视。但只有那些以正确产品体验、API 和商业模式支持 agent 的记录系统才能成功。

编辑观察:Levie 把 agent 看作一种新的“用户”,你的产品是否为此准备好了?如果你的系统没有向 agent 开放 API 或合理的访问控制,agent 会绕道而行。反过来说,如果你的产品是 agent 的数据源,治理能力会成为你的护城河。这是一个机会与颠覆并存的时刻。

PM 视角

Agent 时代的核心资产:治理与辨别力

今天几条消息指向同一个方向:当 AI 从对话走向执行,真正的瓶颈不是模型能力,而是数据层的可靠性和评估层的辨别力。Levie 提到 agent 将大量访问记录系统,这对治理提出了更高要求;而 Madhu Guru 关于 eval 的帖子则指出,好的 eval 需要有辨别力。两者结合,一个清晰的判断浮现:产品建设中,你需要同时投资于“让 agent 安全地做”和“知道 agent 做得好不好”两个层面。

OpenAI 对 Plus 的限制和 DevDay 的预告,提醒我们供应商的资源分配和承诺节奏会直接影响你的产品策略。保持对平台变化的敏感,但不要被短期动态左右。真正的机会在于为 agent 时代构建底层设施,无论是数据层的治理还是评估层的方法,都是当前被低估的领域。

对于创业者,这可能意味着:如果你的产品能够帮助企业在 agent 运行的环境里保持治理和可靠性,或者能够开发出有辨别力的 evals,那么你正站在这波浪潮的有利位置。

以上是 open letters 的编辑判断,不是任何单一来源的原话。

可用的东西

今天就能试:为你的 agent 设计一个“辨别力”检查

如果你在构建 agent 或 AI 产品,用这个 prompt 快速评估你的测试集是否真的有辨别力,而不是盲目增加难度。

你是一个 AI 产品评估顾问。请帮我设计一个评估规划,用于检查我的测试集(eval set)的辨别力。给定以下信息:我当前有5个不同的模型或版本,我想评估它们的能力差异。请给出一个具体步骤,要求:1. 定义一组任务,这些任务要符合实际使用场景,并且难度适中,能让不同能力的系统产生可分离的分数。2. 设计一个简单的‘辨别力指数’,比如用分数的方差或分布重叠程度来衡量。3. 建议如何迭代:当评估结果饱和(所有系统分数都高)时,如何调整任务以保持灵敏度。请用简洁的列表输出,并解释每一步的理由。

这个 prompt 不保证产生即刻可用的 eval,但会给你一个框架。需要你提供自己的任务数据和模型输出,否则无法实际计算。

Madhu Guru 的帖子

顺手记下

融资世界里的“冠军”

Nikunj Kothari 在 X 上分享:每一笔非传统交易在正式打款前都会“死”上 100 次,通常需要一位 champion 站出来为创始人撑腰,并悄悄推动交易完成。对创始人来说,找出真正的内部拥趸,并给他们提供足够的信息来帮你辩护,是很重要的。

这对创业者来说是一个实用提醒:在融资过程中,不要只关注带 title 的合伙人,非投票合伙人和 associate 可能成为你的关键盟友。测试他们对你的支持,也是观察未来合作风格的窗口。

Nikunj Kothari 的帖子

今天的问题:你的产品是否已经准备好被 agent 以一个全新方式访问?还是仍然停留在“人类用户”的假设里?

保持敏锐,明天见。