← 返回往期亮点

2026.08.23 · DAILY LETTER

ELI5、banked reset、eval 平均值陷阱,本周产品人必读

Anthropic 内部流行 ELI5;Codex banked reset 上线;Vercel 跑 is-agentic 到 100;别把 eval 压成一个分数。

早上好。今天是 2026 年 8 月 23 日。这周的动态,有一条共同线索:把复杂的东西变成可重复的动作。

Anthropic 的人在内部大量用 ELI5 来快速理解陌生模块;OpenAI 给 Codex 加了 banked reset;Vercel CEO 用 is-agentic 循环跑到满分。我们挑了三件最值得产品人琢磨的事,外加一条关于 eval 的提醒。

今日要闻

Anthropic 内部流行的 ELI5:用 HTML 卡片讲清任何事

Thariq(Claude Code @anthropicai,前 YC W20)在 X 上分享:Anthropic 内部最近常用一个叫 ELI5 的技能,用法是 /eli5 <你想要解释的东西>,它会“假设我对这个话题一无所知,用一份带大图片、少文字的 HTML artifact 来解释”。他个人喜欢用来做解释器和深入问题,比如“/eli5 这个模块怎么工作”“/eli5 我们为什么做这个取舍”“/eli5 这次事故是什么导致的”。目前还在讨论是否做成官方 plugin,但可以手动安装:claude plugin marketplace add anthropics/claude-plugins-community 然后 claude plugin install eli5@claude-community。

编辑观察:ELI5 的价值不在“简单化”,而在“强制视角转换”。产品经理面对陌生代码库、新同事面对历史决策、复盘时面对事故报告,最缺的不是更多信息,而是一个能把自己当外行重新问一遍的入口。做成带图片的 HTML artifact,等于把“理解”变成可交付物。

Codex 上线 banked reset:ChatGPT Work 和 Codex 付费用户的限额重置新机制

OpenAI 的 Thibault Sottiaux(Codex & ChatGPT @OpenAI)连续发了两条:先宣布“banked reset 已落地,祝周末愉快”,随后补充“banked reset 将在太平洋时间晚上 8 点前就位,对所有 ChatGPT Work 和 Codex 的付费用户生效”。他还更新了关于 Codex 速率限制的情况:部分用户本周缓存命中率比此前稳定状态差,这可能导致额度消耗更快,团队正在调查,明天会有更新。

编辑观察:banked reset 的具体含义没有细说,但结合速率限制的讨论,它大概率是把未用完的额度“存起来”,而不是一刀切重置。对重度使用 Codex 的团队来说,这直接影响成本规划和开发节奏。更值得关注的是缓存命中率:它说明在 agent 工作流里,缓存效率已经开始变成像 GPU 利用率一样需要盯着的指标。

Vercel 用 is-agentic 循环跑到 100/100,CEO 说“修了不少缺口”

Vercel CEO Guillermo Rauch 发帖:“这看着太疯狂了。我们用 is-agentic 对 vercel.com 跑循环,直到它达到 100/100。它让我们关掉了不少缺口。我们努力确保标准是高质量的,值得你花时间和 tokens。”is-agentic 是一个测评工具(具体细节未说明),可以用于测试 agent 在网站上的表现。同时,Vercel 的某个产品(可能是 v0 或某个工具)现在支持用户的 Grok 和 Codex 订阅,可以在 sandbox 里试用,安装是即时的。

编辑观察:把 agent 当作第一用户,用自动化测评循环来替代人工迭代,这正在成为前沿团队的标准做法。100/100 这个分数本身不说明太多,但“循环跑到满分”这个动作值得学,,它不是一次测评,而是把反馈闭环变成日常开发的一部分。

PM 视角

别把 eval 压成一个平均分

Meta AI 高级总监 Madhu Guru 发了一条长推,标题是“如何构建好的 eval - 第 5 部分”,核心劝告:不要把你漂亮而复杂的 eval 套件的结果淡化成一个单一分数。他说这常常是因为某个高管想要一个简化数字来做决定,这在 Gemini 早期也发生过,现在很多团队都有这个问题。他称之为“平均值的暴政”。

他构造了一个例子:一个模型在简单摘要上从 85% 升到 89%,在基础事实问答上从 80% 升到 85%,但在复杂金融分析上从 70% 掉到 63%。单一分数会掩盖模型在你的前沿用例上变差的事实。对加权分数的直觉反应是虚假的数学仪式,只是用一个数字假装掩盖了判断。

他建议:按优先级维护一份 eval 列表(参照他的第 4 部分),找那些能看细节、不追求抽象简化的人,深入理解每个关键 eval 的结果,,哪里失败、哪里出色,,然后判断新 AI 系统对用户是否更好。

对产品经理来说,这不只是技术问题。当你向管理层汇报模型升级效果时,主动拆开分数、指出退化的维度,比给一个上升的均值更负责。它可能让决策变慢,但避免了在错误方向上加速。

以上是 open letters 的编辑判断,不是任何单一来源的原话。

可用的东西

今天就用 ELI5 拆解一个陌生代码模块

适用场景:你刚接手一个不熟悉的模块、想快速理解一个系统设计、或者复盘一次事故。前提是你有 Claude Code 环境,并且能安装 community plugin(权限可能受限)。

假设我完全不了解这个模块的内部实现。请用 HTML artifact 给我一份解释,要求:大图片多,文字少,每个图片配不超过一句话的说明。先列出模块的输入、输出和关键依赖,然后画一张数据流图,标注最可能出问题的环节。最后用三句话总结这个模块的核心职责。如果信息不足,请明确说哪部分不确定,不要编造。

需要 Claude Code 和 community plugin 安装权限。ELI5 不是官方插件,安装后可能不稳定。artifact 的图片是示意图,不一定精确。

Thariq 的 ELI5 示例

顺手记下

用 Claude Code 抓幼儿园午餐 API,自动推送早餐

Nikunj Kothari(partner @fpvventures)分享:他女儿上幼儿园,每日菜单在一个结构混乱的随机网站上。他让 Claude Code 通过网络请求找到 API,碰巧是未认证的,然后让它搞清楚数据格式,接进他们现有的 Hermes bot。现在每天早上家里的 Home bot 会播报早餐和午餐吃什么,方便准备便当。

这个例子对产品人的启发是:agent 最擅长的不是宏大任务,而是把“一个糟糕网页”变成“一个稳定数据流”。你可以自己试:找一个小型日常数据源(比如学校菜单、公司食堂、物业通知),让 Claude Code 解析并推送到你常用工具里。注意权限和稳定性:未认证 API 可能随时失效,需要定期检查。

Nikunj 的分享

这周还有一个值得留意的信号:Peter Yang 批评 Instinct 邮件权限问题,他说“在解决之前无法推荐给任何人”。这提醒我们,agent 的权限边界是用户信任的底线。

如果你试了 ELI5 或 banked reset,欢迎回信告诉我们感受。下周见。