← 返回往期亮点

2026.08.24 · DAILY LETTER

上限重置、eval 爬坡与隐私清理:产品人今日必读

Codex 用量上限明日重置;企业 eval 是 AI 落地瓶颈;用 Claude Code 清理第三方数据;个人 AI 杠杆与组织 AI 杠杆的落差。

早上好。今天是 2026 年 8 月 24 日,周一。这期挑了几条对产品人确实有用的动态:一条关于 Codex 用量上限的官方说明,一条关于 eval 的判断,一条可以直接抄的隐私清理工作流,还有一个关于个人杠杆的组织现象。

先说明:所有事实均来自下方列出的来源,观察只代表 open letters 的判断。昨天 Codex 团队承认了三个浪费用量的问题,明天会重置所有付费订阅的用量,,如果你被上限卡住了,这是好消息。

今日要闻

Codex 用量上限明日重置,背后是一次效率审计

OpenAI 的 Thibault Sottiaux 在 X 上说,Codex 团队发现了三个导致用量超限的问题:长会话中使用图片且多次 compaction 时的低效、Computer History 功能的高 p95+ 用量占用、以及一个本用于生成会话标题的功能消耗超出预期。他们组了一个 tiger team 检查所有环节,明天会带着修复上线,并且会为所有付费订阅做一次完整的用量重置。另外,他们发现了一个与这些问题无关、但能显著提升效率的新方法,下周开始推进。

编辑观察:对 AI 产品经理来说,这三点都是产品细节的真实写照:图片在长会话中的 token 开销、看似无足轻重的后台功能(标题生成)对整体预算的侵蚀。Codex 团队愿意公开承认并重置用量,是难得的透明。另一个值得玩味的是:他们发现了全新的效率提升路径,暗示我们对当前 LLM 用量的理解还远未到最优。下次你做成本优化时,别只盯着模型大小,先审计自己的 harness 和后台任务。

好 eval 是 AI 在企业落地的瓶颈,不只是评测

Box 的 CEO Aaron Levie 在 X 上说,AI 的扩散速度被好 eval 的缺乏限制到远超大多数人的认知。现有模型发布的通用评测很有帮助,但只显示了 AI 整体进步的形状和模型的相对能力。更大的空间在于对企业主要工作流,,细化到具体公司细节,,的 eval。这是一个巨大的领域,因为你无法自动化无法评估进步的东西。企业不能只凭感觉行事。

编辑观察:Levie 点出了一个关键:企业采购 AI 时,eval 不是学术任务,而是信任前提。通用 benchmark 只能告诉你模型有多强,不能告诉你它在你公司的结算流程里会不会翻车。这给了创业公司一个明确的切入点:做垂直 eval 基础设施,或者帮企业建立自己的 eval 集。对内部产品经理来说,这同样是个提醒,,如果你们还没有针对核心流程的 eval,先别急着上大模型。

用 Claude Code 一键清理第三方应用对 Google 的访问权

Peter Yang 在 X 上分享了一个隐私清理工作流:如果你关心隐私,在 Chrome 中打开 https://t.co/yICN6WAe9R(即 Google 账户的第三方访问管理页面),然后运行一个 prompt 在 Codex 或 Claude Code 里,告诉它浏览器中有一个打开的标签页,它会帮你识别并选择要移除的应用。他写道,自己刚用这方法断开了超过一半本不该再拥有其 Google 信息的应用。后续他又补充说,现在可以删除外部数据(比如他的 36 条 Gmail 记录),方法是访问特定页面并滚动到 Data Privacy。他称赞 Instinct 团队响应迅速。

编辑观察:这是一个典型的 agentic 工作流:不再是被动地自己翻设置,而是用 AI 代理主动审计并执行删除。但注意,Peter 用的 prompt 依赖浏览器中打开的标签页,这意味着 agent 需要能感知浏览器上下文。对产品经理来说,这展示了未来 AI 工具的形态,,不是人操作工具,而是工具代理人在人授权下操作数字生活。安全边界的把握很关键,Peter 明确说需要自己挑选要删除的应用,而不是全权委托。

AI 让个人实现 10 倍杠杆,但在大公司里只有 20%,,为什么呢?

Zara Zhang 在 X 上分享了一个现象:有才华的个人在独立做事时,借 AI 能实现潜力 10 倍放大;但当同一个人被放进大型组织里,潜力最多增加 20%,有时甚至下降。这就是为什么越来越多有才华的人离开大公司。唯一的例外可能是顶尖 AI 实验室,比如 OpenAI 或 Anthropic。

编辑观察:Zara 的观察解释了一个人才流动趋势。对你我而言,这暗示了大组织里的 AI 产品推进障碍,,不是说个体不行,而是组织结构、工作流和审批链路跟不上。作为产品经理,如果你在大型组织里推动 AI 项目,可能得思考如何隔离出一个独立的小团队环境,让个体杠杆不被组织惯性消解。对于创业者,这或许意味着去中心化、小团队的产品形态更有吸引力。

PM 视角

企业 AI 落地的下一场争夺战:workflow eval

从 Levie 的判断和 Madhu Guru 的实操建议看,eval 正在从模型评测(benchmark)转向工作流评测(workflow eval)。通用 benchmark 告诉你模型的形状,但企业决策需要知道模型在你特定流程中的表现。这对 AI 产品经理是一个明确信号:不要只依赖模型发布时的分数,要为你的产品建立专属 eval 集。

Guru 在另一篇帖子里(同样在来源中)给出了具体的方法:hill climbing on evals 的本质是选定一个维度并优化,比如基于生产数据提升关键用户旅程的质量、扩展相邻用例、降低成本或延迟。实际工作大部分落在更好的 harness 和模型选择上,包括 prompt eng、context eng、memory、post training,甚至老派的确定性代码。他还建议从失败模式分类开始,找到产品最薄弱的地方,比如工具调用失败率过高,可能是你塞了 20 个工具进 context,但实际上每个任务只需 3-5 个。

这给产品经理的启示是:eval 不是一次性的评估,而是一个持续爬坡的过程。从利用最好的模型起步,确保用户体验不错,再逐步用更小、更便宜、更快的模型去逼近同等质量,期间始终需要 eval 告诉你是否在正确的方向上。换句话说,eval 是产品迭代的指南针,而不是发布前的检查清单。

以上是 open letters 的编辑判断,不是任何单一来源的原话。

可用的东西

今天就能做:用 Claude Code 清理你的第三方 Google 权限

Peter Yang 分享的工作流,适合对隐私敏感、已经有点过度授权第三方应用的你。前提是你用 Chrome 浏览器,并且已登录 Google 账户。你需要一个 Codex 或 Claude Code 的环境。本质是让 AI 代理读取浏览器当前标签页的内容,再帮你操作。

我的 Chrome 浏览器中有一个标签页,打开的是 Google 账户的第三方访问权限管理页面(accounts.google.com 下)。请先读取这个标签页的内容和页面上的应用列表。然后浏览这个列表,找出那些我已经不再使用、或者授权时间很久且来源不明的应用。请列出你建议移除的应用和理由,但要保守一点,,只建议移除那些你认为确实不重要的。不要去操作真正高频使用的服务(比如在线存储、邮件客户端等)。在列表确认后,我会告诉你哪些可以移除,你再逐一执行。移除后,请报告每个操作的结果和是否成功。如果页面需要登录或验证,请停下来告诉我。

此 prompt 依赖浏览器中已打开的页面和 agent 对浏览器环境的读取能力。不是所有 Codex/Claude Code 版本都支持访问浏览器标签页内容;如果不支持,prompt 会失效。务必自己审查 AI 建议的移除清单,因为 AI 无法判断某个应用是否仍对你重要。执行前,建议手动备份关键数据,以防误删。

Peter Yang (@petergyang) on X

顺手记下

AI“技能”的命名学:/fuck-cancer

Peter Yang 在 X 上透露自己在做一个新的 AI skill,名字叫 /fuck-cancer。目的是帮助患者和家人导航整个治疗流程并保持信息灵通,并向关注者征求意见应该包含什么。这条帖子只有 237 次互动,但名字本身很有感染力。

这提醒我们,AI 产品的情感化命名是稀缺的。对产品经理来说,技能/工具的名字本身就是传达意图和情绪价值的方式。/fuck-cancer 比“癌症导航助手”更有力量,但要注意语境和品牌安全。如果你在垂直领域做 AI 产品,名字可以更大胆,只要不越界。

Peter Yang on X

今天问你的问题是:你最近一个 AI 产品迭代,有没有一个真正能指引方向的 eval?如果没有,今天值得花一小时,从失败模式开始。

明天见。