头条:Anthropic 发布 Claude Opus 5 — 近旗舰性能,每日驱动级定价

Anthropic 正式推出 Claude Opus 5,延续 $5/$25 每百万输入/输出 token 定价,但宣称提供接近旗舰 Fable 5 的智能水平,标志着 AI 竞争从”最强模型”转向”最强性价比”。Opus 5 在 Frontier-Bench v0.1(Agentic 终端编码基准)得分 43.3%,是 Opus 4.8(18.7%)的两倍,甚至超越 Fable 5(33.7%)。在 OSWorld 2.0(计算机使用基准)上以 Fable 5 三分之一成本超越其成绩。新增可调节”effort”参数,Harvey 报告同性能下平均节省 26% token,Fundamental Research Lab 称金融建模任务准确率提升 9pp 同时减少 60% 时间。Anthropic 明确分层定位:Opus 5 为”日常驾驶”,Fable 5 为数天级自主项目,Sonnet 5 为规模化调用,Haiku 4.5 为子 Agent 和即时响应。VentureBeat | Anthropic News

微软发布 MAI 自研模型全线作战,成本直降 89%

微软 AI 超级智能团队发布 MAI-Image-2.5-Pro(高保真图像生成)和 MAI-Voice-2-Flash(高速企业语音模型),现已部署至 Bing、PowerPoint、OneDrive、Dynamics 365、Excel、GitHub Copilot 和 Azure 全线产品。关键数据:PowerPoint 中 GPU 成本降低 84%(对比 GPT-Image-2),OneDrive 保存率提升 26%、P95 延迟降低 25%,Dynamics 365 联系中心 GPU 成本降低 89%。Dragon Copilot 已切换至 MAI-Transcribe-1.5,支撑 170,000 医疗机构、28M 患者诊疗/季度、58 种语言。微软披露”爬山策略”(hill-climbing machine):数据-模型-产品 harness 飞轮,MAI-Code-1-Flash 在 Excel 公式生成上超越 GPT-5.6。信号明确:Microsoft 产品由 Microsoft 模型驱动的时代已到来。VentureBeat

OpenAI 发布 Presence:企业级 Agent 全托管平台

OpenAI 推出 Presence 企业产品,用于部署和管理实时语音 Agent 与聊天机器人。核心能力:基于策略的权限控制、模拟测试、护栏系统、Codex 驱动的持续性能监测与自动优化。Agent 可调用公司知识库、SOP、批准流程,并支持通过 API 接入第三方模型(如 GLM-5.2、Kimi K3)做护栏和工具。OpenAI 自用 Presence 支撑 1-888-GPT-0090 电话客服通道,75% 问题无人工解决,10 天内人工转接率降低 15pp。不开源自服务,需 OpenAI FDE 或系统集成商主导部署。VentureBeat

OpenAI GPT-Live 全双工语音进入 Codex,编程进入免提时代

OpenAI 将 GPT-Live 全双工语音(可同时听和说)集成至 ChatGPT 桌面应用(macOS/Windows),直接驱动 Codex 和 ChatGPT Work。开发者可用自然语音指挥多线程编码任务:同时调查认证 bug、审查 API 迁移 PR、生成单元测试。多人同室对话同一模型实例成为现实。支持 macOS Appshots 屏幕上下文、多文件夹项目(build 26.715)和 iOS 远程执行。面向 Plus/Pro/Business/Enterprise/Education 订阅用户。10M+ 周活用户的免提编程时代拉开序幕。VentureBeat

Black Forest Labs 发布 FLUX 3:图像+20秒视频+音频统一生成

FLUX 3 采用联合训练架构,单一模型原生支持图像、最长 20 秒视频(含对白/音效)生成,而非拼接独立模型。提供四条产品线:FLUX 3 Video(含原生音频)、FLUX 3 Image、FLUX 3 Action(机器人视觉/操作)、FLUX 3 Dev(后续开源权重)。初期限量开放 Early Access,无公开 API/定价。在 10 秒 720p 文本转视频偏好测试中,FLUX 3 以 93% 胜率击败 Luma Ray 3.2、77% 击败 Runway Gen-4.5、69% 击败 Grok Imagine Video。BFL 旨在打造”可感知、预测和行动的统一视觉智能”。VentureBeat

VentureBeat 研究:573 家企业揭示 AI Agent 五大治理缺口

VentureBeat Research 基于 573 位企业领导者、五项平行调查发现:71% 的企业部署的”Agent”本质上仍是单轮对话机器人;69% 允许 Agent 共享凭证,导致安全事件率高达 63.5%(vs 独立凭证的 40.9%);80%+ 自建 GPU 企业利用率低于 50%;57% 的企业在过去 6 个月经历过因上下文数据缺失导致的自信错误回复。57%-68% 的企业计划 12 个月内更换或新增供应商。Agent 治理正在从可选项变为必选项。VentureBeat

Hacker News:AI 的”专注与跟进”新能力引热议

一篇题为”The New AI Superpowers: Focus and Followthrough”的文章登上 HN 首页,获 129 分、43 条讨论。文章论述当前 AI 模型在长时间自主任务中的”专注力”和”跟进执行能力”正成为比原始智能更重要的差异化维度,与 Anthropic 对 Opus 5 vs Fable 5 的”边界任务 vs 长周期自主”分层论述不谋而合。Hacker News

Hacker News:Token 转售与欺诈的”中继市场”揭秘

一篇深入分析 token 转售地下经济的文章获 146 分、91 条讨论。揭示通过 API 中继市场非法转售 AI token 的完整产业链,包括定价套利、欺诈检测规避和账户劫持模式。Hacker News

GitHub 热门:impeccable — AI 驱动的设计语言系统

设计师 pbakaus 发布 impeccable,号称”让你的 AI 更擅长设计”的设计语言系统,获 50,655 星。为 AI 驱动的 UI 生成提供设计约束和组件规范,弥合 AI 输出与专业设计品质之间的鸿沟。GitHub

GitHub 热门:ego-lite — 专为 AI Agent 打造的最快浏览器

citrolabs/ego-lite 获 4,488 星,单日新增 900 星。号称”最快的 AI Agent 浏览器”,允许 Codex、Claude Code 等 Agent 共享登录浏览器态进行 Web 自动化,零成本零配置,不干扰用户操作。GitHub

GitHub 热门:Chat2DB — AI 驱动的数据库管理工具

OtterMind/Chat2DB 获 27,095 星,日增 398 星。支持 MySQL、Oracle、PostgreSQL、ClickHouse 等主流数据库的全能 AI 驱动 SQL 客户端和数据库管理工具。GitHub

GitHub 热门:Instatic — Agentic 自助建站 CMS

CoreBunch/Instatic 获 5,654 星,日增 888 星。号称开源的 Webflow/Framer/WordPress 替代品,Agentic 自托管可视化 CMS,支持用户、角色、插件、内容管理和数据库,输出纯净静态页面。GitHub

Inflection AI 回归消费者市场:推出 Pi Journeys

经历了微软的人员动荡后,Inflection AI 重返消费者市场,推出 Pi Journeys 产品。该产品定位为 AI 引导的互动体验,标志着 Inflection 在经历核心团队被微软挖走后重新确立消费者 AI 定位。VentureBeat