📰 头条新闻
1. Anthropic 发布 Claude Opus 5:编码与Agent工作流的性价比之选
Anthropic 于7月24日发布 Claude Opus 5,定位为”日常主力”模型。定价保持在 $5/百万输入 tokens、$25/百万输出 tokens,在 Frontier-Bench(终端编码基准)上得分 43.3%(Opus 4.8 仅 18.7%),ARC-AGI 3 得分是第二名模型的3倍。Opus 5 配备可调节的”effort”设置,允许用户在智能与速度/token消耗之间做取舍。Harvey(法律AI公司)报告称在同等任务下令牌消耗减少26%,Zapier 的 AutomationBench 达成100%通过率。Anthropic 将其定位为介于 Fable 5(超长自主任务)和 Sonnet 5(大规模批量任务)之间的”日常复杂工作首选”。
2. Anthropic CEO 发文:从未主张开源模型禁令
7月27日,Anthropic CEO Dario Amodei 发表长文澄清公司立场——Anthropic 从未倡导禁止开源模型。开源模型若无危险能力则属于公共产品。Amodei 支持三项实际措施:(1) 不向中国出售先进芯片及设备,并打击走私;(2) 打击工业级蒸馏行为;(3) 所有足够强大的模型(无论开源还是闭源)必须通过强制性安全测试。该文在 Hacker News 获得 372 分和 473 条评论,成为当日 HN 最热讨论。
3. OpenAI 将 GPT-Live 全双工语音控制带入 Codex 和 ChatGPT 桌面端
7月23日,OpenAI 宣布其全双工语音模型 GPT-Live 集成到 ChatGPT 桌面应用(macOS/Windows),支持开发者通过自然语音指令编排多线程编码任务、审查 PR、调试应用。该架构将实时语音层与底层执行引擎解耦,开发者可同时发起多项任务——如同时调查认证漏洞、审查 API 迁移 PR、生成单元测试——全程免提操作。支持 Appshots 屏幕上下文分析,多人同室协作编码。
4. Microsoft 发布自研 AI 模型:成本较 OpenAI 降低高达 89%
7月23日,微软发布 MAI-Image-2.5-Pro(旗舰图像生成)和 MAI-Voice-2-Flash(高并发语音模型),并详细披露部署数据:Bing Image Creator 已完全切换至自研模型;PowerPoint 中 GPU 成本降低84%;OneDrive 中保存率提升26%、延迟降低25%;Dynamics 365 联络中心 GPU 成本降低89%。这些模型已运行在 Bing、PowerPoint、OneDrive、GitHub Copilot、Excel 和 Azure 中,标志着微软自研模型从研究项目正式转为生产基础设施。
5. Black Forest Labs 发布 FLUX 3:图像+20秒视频+音频多模态模型
7月23日,BFL 发布 FLUX 3,首个联合训练的图像/视频/音频多模态模型,支持 20 秒带音频视频生成。FLUX 3 包含四个产品线:Video、Image、Action 以及即将开源的 Dev 版本。在初步评测中,10秒720p视频生成偏好率较 Luma Ray 3.2 达93%、Runway Gen-4.5 达77%。但目前仅限早鸟访问,尚未公布定价和完整基准测试方法。
6. VB 研究:企业 AI Agent 治理五大缺口
VentureBeat Research 发布基于 573 名企业领袖的五项平行调查报告,揭示关键发现:71% 的企业所谓的”Agent”实际仅能完成单步对话;允许共享凭据的企业安全事件率高达63.5%(独立身份管控企业仅40.9%);80% 以上自建 GPU 的企业利用率不足50%;57% 的企业因缺失业务上下文导致 Agent 给出错误自信回答。68% 的企业计划在12个月内更换或新增编排平台。
7. Claude 共享对话与 Artifacts 被 Google 索引引发隐私关注
7月27日,Reddit 用户发现用户通过 share 链接分享的 Claude 对话和 Artifacts 被 Google 搜索索引并可公开访问。VentureBeat 独立验证了部分 Artifacts 确实可通过 Google 搜索找到。Anthropic 回应称这些链接是用户主动选择公开分享的内容,类似于 Google Doc 的”Anyone with the link”分享方式。事件引发关于 AI 协作平台隐私预期的广泛讨论。
8. AI 搜索时代:引用流向深层页面,但用户被引向首页
Laurie Voss 在 VentureBeat 撰文分析 AI 搜索对 web 生态的影响。Pew 研究显示 Google AI 摘要出现时,用户点击传统结果的概率仅8%(无摘要时为15%)。谷歌搜索广告份额预计在2026年首次跌破50%。ChatGPT 搜索更新后,品牌推荐引荐流量一周内激增157%,但落地首页的比例从25%翻倍至60%。Sponsored 结果已出现在26%的 ChatGPT 桌面对话中。
🔬 模型与平台更新
9. Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber
Google DeepMind 发布了 Gemini 系列多款新模型。3.6 Flash 作为快速迭代版本进一步提升推理效率;3.5 Flash-Lite 面向低成本大规模部署场景;3.5 Flash Cyber 则专注于网络安全领域,提供针对威胁检测和代码安全分析的能力。同期还发布了 Gemini 3.5 Flash 的 Computer Use 能力,以及 Nano Banana 2 Lite 和 Gemini Omni Flash 等开发工具。
🛠️ 开发者工具与开源
10. pbakaus/impeccable — AI 设计语言框架(⭐ 51.5k,今日 +847)
开源设计语言系统,旨在让 AI 工具在 UI/UX 设计方面表现更好。提供组件库、设计 token 和 AI 友好的设计规范,今日表现最为抢眼的 AI 项目之一。
11. moeru-ai/airi — 自托管 AI 伴侣(⭐ 44k,今日 +572)
基于 TypeScript 的开源自托管 AI 伴侣应用,支持实时语音对话、Minecraft/Factorio 游戏互动,兼容 Web/macOS/Windows。该项目试图复现 Neuro-sama 级别的交互体验。
12. alibaba/open-code-review — 阿里巴巴开源代码审查工具(⭐ 14.8k)
阿里巴巴开源的混合架构代码审查工具,结合确定性流水线和 LLM Agent,提供精确的代码行级评论。内置针对 NPE、线程安全、XSS、SQL 注入等问题的规则集,兼容 OpenAI 和 Anthropic API。已在内部门店验证并开源。
13. shiyu-coder/Kronos — 金融市场基础模型(⭐ 34.6k,今日 +441)
面向金融市场语言的 Foundation Model,旨在用 AI 理解和生成金融领域的数据与信号。今日在 GitHub 上获得大量关注。
14. bradautomates/claude-video — 让 Claude 观看视频(今日 +434 星)
开源工具,让 Claude 能够通过下载、提取帧、转录等步骤”观看”任何视频内容。展示了 Anthropic 模型在多模态理解方面的应用潜力。
15. Hacker News 热门:Opus 5 在 SlopCodeBench 基准测试
HN 用户对 Anthropic 新发布的 Opus 5 进行了 SlopCodeBench 基准测试(67分/15评论),测试其在”垃圾代码”识别与清理方面的表现,结果显示 Opus 5 相比 Opus 4.8 有显著提升。
📊 每日数据看板
| 项目 | 数据 |
|---|---|
| Anthropic Opus 5 定价 | $5/$25 每百万 tokens(输入/输出) |
| Microsoft 自研模型 GPU 成本降低 | 最高 89% |
| ChatGPT 搜索 Sponsored 占比 | 26%(6月桌面端) |
| 谷歌搜索广告份额(2026预估) | 跌破 50% |
| VB 调查:GPU 利用率 < 50% 的企业 | >80% |
| GitHub impeccable 今日新增星数 | +847 ⭐ |
| Anthropic 开源立场 HN 热度 | 372 points / 473 comments |
本日报由 AI 自动采集编辑,覆盖 2026年7月23日~27日期间核心AI产品研发动态。