🔥 今日看点

  • Anthropic 发布 Claude Fable 5.1 / Mythos 5.1:缓存读取降价 75%($1.00 → $0.25/百万 token),长时 Agent 任务成本大降,并推出 Enterprise Frontier Safeguards 企业安全架构
  • OpenAI 发布 Path to Astra 路线图:新模型 Astra 在 ExploitBench 满分,网络安全能力将限量开放,为防滥用收紧高风险访问
  • Perplexity 推出混合计算:云端前沿模型 + Mac 本地小模型动态分工,Privacy Gate 确保敏感数据不出设备
  • OpenClaw 2.0 发布:开启”多人协作”AI 编码时代,共享云会话、全新 Control UI、强化权限与沙箱

📰 模型与产品动态

1. Claude Fable 5.1 / Mythos 5.1 发布:缓存读取降价 75%,新增企业级安全架构

Anthropic 发布最强模型 Claude Fable 5.1(正式版)与 Mythos 5.1(受限访问版,面向网络安全与生命科学机构)。API 价格维持 $10/$50 每百万 token,但缓存读取从 $1.00 降至 $0.25(仅为输入价的 2.5%),典型工作负载有效成本降约 25%、高 Agent 负载降约 45%。基准上 Terminal-Bench-Science 0.1 达 52.6%(Fable 5 仅 24.7%)、CursorBench 3.2.0 达 73.4%;客户案例包括 Millennium 定位四年未解的罕见崩溃、Ramp 的 38 小时无人值守 ML 实验。同时发布 Enterprise Frontier Safeguards(EFS),让企业把监控数据保留在自控基础设施内。
阅读全文 · 官方公告

2. OpenAI 发布 Path to Astra:关键能力与前沿防护路线图

OpenAI 发布 Path to Astra 一文,介绍新模型 Astra 的”关键能力与前沿防护”。据 HN 社区讨论,Astra 在 ExploitBench 漏洞利用基准上取得 100% 满分,token 效率较 GPT-5.6 Sol 提升约 2-3 倍;OpenAI 计划尽快开放 Astra,但最先进的网络安全能力将先限量提供给测试者,并通过 Daybreak Blue 扩展防御用途。文章同时回应了此前 Hugging Face 安全事件,称现行防护措施可预防类似事故,并已为 Astra 强化拒绝有害网络请求的训练。该文登 HN 热榜获 80 分。
文章 · HN 讨论

3. Perplexity 推出混合计算:敏感数据留在 Mac 本地,云端只跑”安全部分”

Perplexity 为其 Agent 平台 Computer 发布混合计算:一个 Agent 可在云端前沿模型与 Apple Silicon Mac 本地开源模型之间动态分工——联网研究、长程规划在云端执行,触及私有文件与设备操作的部分则下放给本地子 Agent,全程不重启任务、不丢上下文。核心是公司自训练的 Privacy Gate(PII 分类器):任何敏感信息在发往云端前被拦截。本地 token 不消耗积分,仅编排与委派计费。首发本地模型包括 Gemma E4B、Qwen3.6 35B-A3B 及 Perplexity 后训练的 Qwen3.6 35B,适用于 macOS 15+ 的企业与 Pro/Max 用户。
阅读全文

4. OpenClaw 2.0 发布:开启”多人协作”AI 编码时代

开源 AI Agent 框架 OpenClaw 发布 2.0(v2026.8.1),被视为迄今最大更新。核心转变是从个人 Agent 走向团队共享基础设施:全新 Control UI 以对话为主界面(对齐 ChatGPT/Claude 交互习惯),新增共享云会话与多用户协作——会话可持久化、跨设备/云端执行、支持所有权归属与审批升级;安全模型大幅强化(沙箱、角色权限、审批控制、密钥处理与审计)。作者 Steinberger 透露团队已用”OpenClaw 构建 OpenClaw”,称本地单人 harness”已成过去式”。Solvely 等团队已开始采用。
阅读全文

5. Google Research:模型”记得”却”想不起”——推理时间计算可恢复 65% 事实

Google Research 与 Technion 的新研究表明:GPT-5、Gemini-3 等前沿模型编码了 95-98% 的测试事实,幻觉主因是”回忆失败”而非”知识缺失”。团队用 WikiProfile 基准(2,150 条维基事实、13 个模型、400 万+ 响应)建立事实级画像,区分直接回忆、编码失败、回忆失败、思考回忆与无编码推理五种知识状态。关键发现:增加推理时间计算可成功恢复 40-65% 原本无法直接回忆的编码事实,类似人类的”话到嘴边”现象——这为不依赖更大模型或外部数据库提升可靠性提供了新路径。
阅读全文

6. World Labs 发布 Atlas:原生多模态世界模型,支持 1440p 一分钟视频生成

World Labs 推出下一代世界模型 Atlas:从零预训练的原生多模态模型,统一处理文本、图像、视频与 3D,架构为多模态自回归扩散 Transformer,所有输入共享空间上下文。能力覆盖:像素级相机控制的图像/视频生成(最多 6 张输入图、输出 1440p 一分钟视频)、真实场景 3D 重建(新视角 + 显式 3D 输出,超越专用重建模型)、时空模拟(视频重取景、面向机器人的 Real-to-Sim)以及 360° 全景图像生成。Atlas 将驱动 Marble 及 World Labs 后续产品,现已开放早期访问申请。该文登 HN 热榜获 137 分。
官方博客 · HN 讨论


🌐 Hacker News 热门讨论

7. 1.5 小时从零训练小 Transformer:ARC-AGI-1 达 44%,击败众多大模型(559 分)

开发者 Mithil Vakde 在单张 RTX 5090 上用 1.5 小时从零训练一个小型 Transformer,ARC-AGI-1 公开评测达到 44%(成本仅 67 美分),与 TRM/HRM 持平、超过许多大模型,并在 ARC-2 上取得 7%。作者认为样本效率是当下 AI 最重要的课题,该系列工作此前已获 Lucas Beyer、Jeremy Howard、Rohan Anil 等研究者关注。登顶今日 HN 热榜(559 分),再次印证”小模型 + 高效训练”路线的社区热度。
文章 · HN 讨论

8. ChatGPT/Codex 桌面应用捆绑完整 LibreOffice(222 分)

Simon Willison 发现 OpenAI Codex 桌面应用(已更名为 ChatGPT)的缓存目录 codex-primary-runtime 占用 1.7GB,内含完整 Python、Node.js 运行时及 Poppler、git、LibreOffice 办公套件的原生二进制,并通过内置 skills 指导 Agent 调用这些工具处理文档。这揭示了 Agent 产品的新形态:为让模型可靠操作文档,直接把整个办公生态打包进运行时,而非依赖远端服务。获 HN 222 分热议。
文章 · HN 讨论

9. Show HN:104GB Qwen3.8-Flash-Next 跑进 48GB Mac,约 12 tok/s(134 分)

开发者 carloslfu 发布 slotstream 项目:通过流式权重卸载(streaming weight offload)技术,让 104GB 的 Qwen3.8-Flash-Next 模型在 48GB 统一内存的 Mac 上以约 12 token/s 运行。这条”小显存跑大模型”的路线与 M4 Pro Mac Mini 本地模型搭建帖(35 分)一起登上 HN,反映本地推理社区正通过量化、卸载与流式加载持续压低”跑大模型”的硬件门槛。
仓库 · HN 讨论


10. THU-MAIC/OpenMAIC:开源多智能体交互课堂(+3,128★ 今日)

清华团队的多智能体交互课堂项目连续两日登顶 Trending(昨日 +2,824★,今日 +3,128★):一键获得沉浸式多智能体学习体验,多个 AI 角色协作授课、问答与演练,把”课堂”变成可编排的多 Agent 场景。单日数千星的增速说明 AI 教育正从”聊天辅导”走向”多角色协作教学”的产品化阶段。
仓库

11. jingyaogong/minimind:2 小时从零训练 64M 参数 LLM(+1,005★ 今日)

minimind 教你在 2 小时内从零训练一个 64M 参数 LLM:覆盖预训练、指令微调、对齐与推理全流程。与 HN 热榜上”1.5 小时小 Transformer 击败大模型”的帖子同频,开源社区对”小模型高效训练”题材的热情持续升温——用最小成本讲清楚 LLM 训练全流程,兼具教育价值与实用意义。
仓库

12. K-Dense-AI/scientific-agent-skills:AI 科学家技能库(+912★ 今日)

号称”把任意 AI Agent 变成 AI 科学家”的技能库:开箱即用的科学 Agent 技能,覆盖研究 → 写作 → 审阅 → 修订 → 定稿全流程,宣称已被全球 19 万+ 科学家使用。Agent Skills 模式正加速向垂直领域渗透——科学研究的可复用技能包与 OpenMAIC、专利技能等一起,构成”技能即产品”的生态雏形。
仓库

13. browser-use/video-use:用编码 Agent 编辑视频(+472★ 今日)

browser-use 团队推出 video-use:让编码 Agent 直接操作视频编辑——Agent 可调用视频处理工具完成剪辑、转场与合成,把”视觉内容生产”纳入 Agent 工作流。作为 browser-use(浏览器自动化)的姊妹项目,video-use 延续”给 Agent 一个可操作的真实工具面”的思路,向多模态内容生产场景延伸。
仓库

14. affaan-m/ECC:Agent 性能优化系统(+623★ 今日)

ECC 定位”agent harness 性能优化系统”:整合 skills、instincts、memory、security 与 research 模块,为 Agent 运行提供系统级调优与加固。随着企业 Agent 从原型走向生产,围绕 harness 的工程化(性能、记忆、安全)正成为 GitHub 上的新热点,与 OpenClaw 2.0 的”共享 Agent 层”叙事相互印证。
仓库


本日报由 TimLake AI 编辑自动采集整理,数据来自 VentureBeat、Anthropic、OpenAI、Hacker News、GitHub Trending 等公开来源。