🔥 今日看点

  • OpenAI 正式发布 GPT-6 Astra:Brockman 在发布会结尾高调宣布”欢迎来到 AGI 时代”,模型主打像人一样操作电脑的多步工作流;API 定价 $10/$50 每百万 token,登 HN 榜首获 1223 分
  • 微软 MAI-Transcribe-2 以 $0.10/小时早鸟价入场,较上代直降 72%,60 语言 FLEURS 登顶,语音转写价格战白热化
  • 阿里 Qwen 3.8 27B 上线 Cerebras 推理,实测约 1500 token/s,主打 Agentic 编码的多模态 27B 稠密模型
  • ChatGPT、Claude、Grok 三大服务同日集体宕机数小时引发 518 条讨论;ARC Prize 独立实测 Astra 标准 harness 仅 62.7%,”98.6% ARC-AGI-3”之争升温

📰 模型与产品动态

1. OpenAI 发布 GPT-6 Astra:最强的”电脑操作员”模型,宣告 AGI 时代

GPT-6 Astra 是 OpenAI 迄今最大规模训练(Stargate 超 10 万 DBU,首次由前代模型监督训练下一代),定位”世界最好的 computer use 模型”:无需为每个应用写 API 集成,直接像人一样操作浏览器、表格、桌面软件,语音即可完成做 3D 游戏、上架 eBay 等多步任务。OSWorld 2.0 离线子集 72.6%(单任务约 40 分钟),较 GPT-5.6 Sol 的 65.7%/75 分钟快约 47%;FrontierMath Tier 4 v2 97.6%、DeepSWE v1.1 74.1%(最高配置每任务 API 成本低约 57%)、自测 ARC-AGI-3 98.6%。API 名 gpt-6-astra,标准价 $10/$50 每百万 token,支持 Zero Data Retention。经 Daybreak 门控计划先行开放,随后铺向 ChatGPT 全系、API、AWS Bedrock 与 Azure。Brockman 强调企业应看”每完成任务价格”而非 token 单价。
官方发布 · VentureBeat · HN 讨论

2. ARC Prize 独立实测 Astra:62.7% 还是 99.9%,取决于 harness

ARC Prize 官方在发布当日给出独立评测:GPT-6 Astra(max)在标准 harness 下 ARC-AGI-3 Semi-Private 得分 62.7%(成本 $26K),而用 Provider Adapter harness 高达 99.9%($19K),均为当前 SOTA。更引人注目的是行为层面:Astra 在 96% 的关卡中比人类中位数用更少动作解出谜题,能把陌生环境抽象成符号世界模型并自创 DSL 速记来规划。这与 NVIDIA 8 月 AVO 的结论一致——长时程智能来自完整 Agent 系统而非模型本身,也让”98.6% 是否等于 AGI”的争论有了更扎实的注脚。
ARC Prize 分析 · HN 讨论

3. 微软 MAI-Transcribe-2:$0.10/小时,把转写打成”不值得争论的账单”

微软 AI 自研语音模型更新:早鸟价 $0.10/小时音频(5 个月前初代 $0.36,直降约 72%),支持 60 种语言(初代 25 → 1.5 代 43)。基础价即捆绑说话人分离、词级时间戳、关键词偏置、自动语种识别、verbatim/clean 双输出风格与 Hinglish/Spanglish 等语内混切——这些过去都是专业厂商的付费项。FLEURS 60 语平均 WER 5.2% 居首,Artificial Analysis 词错率榜第二并定义”精度-延迟帕累托前沿”。已上线 Microsoft Foundry 与 MAI Playground,并开始替换 Copilot Voice、Teams 里的第三方/旧模型,是微软逐模态自研、摆脱对 OpenAI 依赖的最清晰信号。
阅读全文

4. 阿里 Qwen 3.8 27B 上线 Cerebras:约 1500 token/s 的 Agentic 编码模型

Qwen 3.8 系列新旗舰 27B 稠密多模态模型上线 Cerebras 公共端点:实测约 1500 token/s(免费档上下文 64k,付费档 128k,最大输出 40k),支持文本+图像输入与可配置推理,面向 Agentic 编码、工具调用、研究类长程任务。Cerebras 端定价 $0.99/$1.49 每百万 token(输入/输出),登 HN 获 427 分。社区关注点在于:接近 GPT-5.6 Sol max 级别智能指数(61)的开放模型,配合每秒上千 token 的推理速度,本地与实时 Agent 场景的门槛再次被拉低。
Cerebras 模型页 · HN 讨论

5. IFM 开源 K2 Horizon:六模型”舰队”,史上最彻底的开源发布

Institute of Foundation Models 发布 K2 Horizon 模型舰队:375B-A23B、36B-A4B、32B、7B、3.7B、0.9B 六个模型一次放出,其中 0.9B/3.7B/7B 在各自量级刷新 SOTA(0.9B AIME 2026 超 48 分),36B-A4B 用新的 MoVA(Mixture-of-Value-Attention)稀疏注意力架构实现接近 32B 稠密模型的性能。全部 Apache 2.0,并开放从预训练到后训练的全生命周期:中间 checkpoint、数据配方、训练代码、日志与评测结果,覆盖边缘设备到企业场景。被评价为”迄今最全面的开源模型发布”,HN 讨论 242 分。
官方博客 · HN 讨论


🌐 Hacker News 热门讨论

6. ChatGPT、Claude、Grok 同日集体宕机:基础设施级联故障?(322 分)

OpenAI、Anthropic、xAI 的服务在相近时间窗口集体故障数小时(各自状态页均标记 Resolved,三个独立讨论帖合计 600+ 评论)。HN 用户观察到 Cloudflare、Azure、AWS、Google Cloud 的错误上报在约 7:30 PT 同步攀升,猜测是公共基础设施层故障级联到依赖方;也有观点指出 Downdetector 数据以搜索量为代理、可能放大恐慌。值得注意的是 Gemini 全程未受影响。事件再次把”AI 供应链单一故障点”问题摆上台面——当所有大模型都架在同一批云与 CDN 上,同时宕机可能不再是巧合。
HN 讨论

7. Google Antigravity 服务条款争议:第三方使用可能导致 Google 账号被暂停(269 分)

Gergely Orosz 发文指出 Google Antigravity(Google 的 Agentic IDE)服务条款中,使用第三方工具/服务的行为可能触发 Google 账号暂停,开发者担心平台账号与 AI 开发工具深度绑定的风险。评论区多位用户报告 AI Pro 订阅配额更新延迟、无解释限制等问题,讨论延伸至”工具链锁定 vs 账号安全”的边界、条款可读性以及 Google 客服黑洞。对把 Antigravity 纳入工作流的开发者是重要提醒:读条款、隔离账号、避免把生产凭据绑在消费级账号上。
HN 讨论

8. 实测 17,000 次运行:Claude、Codex、Cursor 究竟会安装哪些工具?(73 分)

Armature 团队公布对三大编码 Agent 的 17k 次运行观测:统计它们在真实任务中主动安装/调用的工具链(语言服务器、格式化器、测试框架、MCP 服务器等)。数据揭示各家 Agent 的工具偏好与”默认行为”差异显著——例如某些 Agent 更倾向自写脚本而非装现成 CLI,直接影响任务耗时与成功率。对 Agent 工具链开发者来说,这类”行为测量”比 benchmark 分数更能指导产品设计:与其猜 Agent 会用什么,不如直接看它 17,000 次里实际做了什么。
报告 · HN 讨论


9. anthropics/skills:Anthropic 官方 Agent Skills 仓库上榜(+281★ 今日)

Anthropic 官方维护的 Agent Skills 公共仓库(累计 17.4 万星)。Agent Skills 正在成为 Claude Code/Codex 等工具的标准能力封装单位,官方仓库的上榜标志着”技能生态”从社区自发走向平台官方治理——开发者可以直接复用官方验证过的技能定义,而不是各自发明格式。
仓库

10. obra/superpowers:把”技能”做成一套开发方法论(+462★ 今日)

Jesse Vincent(Obra)开源的 agentic skills 框架与软件开发方法论(累计 28.1 万星):不只是零散技能包,而是配套完整开发流程的技能体系。它在 Trending 上与 anthropics/skills、mattpocock/skills 等仓库同屏出现,说明”给 Agent 装备可复用技能”正从个人技巧演变为团队级工程实践。
仓库

11. affaan-m/ECC:面向多 Agent 的 harness 性能优化系统(+751★ 今日)

ECC 定位为”Agent harness 性能优化系统”:把技能、本能(instincts)、记忆、安全与研究优先开发整合为一套配置,横跨 Claude Code、Codex、Opencode、Cursor 等多个前端(累计 24.7 万星)。随着企业同时跑多个编码 Agent,跨工具的标准化”驾驶舱”需求正在催生新的工具品类。
仓库

12. blader/humanizer:给 Agent 输出”去 AI 味”的技能(+1,208★ 今日)

一个颇具争议却快速走红的 Agent 技能:从文本中移除 AI 生成痕迹(累计 4.1 万星,今日 +1.2k)。走红本身即是信号——当 AI 写作大规模进入工作流,”机器味”已成为真实的生产力成本,无论用于内容合规还是个人表达,这类后处理技能正在变成 Agent 流水线的标准一环。
仓库

13. magnitudedev/magnitude:接进你现有 Agent 的开源本地推理服务器(+161★ 今日)

开源推理服务器:针对本机硬件跑最优本地模型,并直接”插进”你正在用的 Agent——兼容 Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Cline 等(累计近 2 千星,今日 +161)。与 Cerebras 等云端高速推理形成互补:本地派 Agent 用户想要的是”模型可换、Agent 不变”的私有化自由。
仓库


本日报由 TimLake AI 编辑自动采集整理,数据来自 OpenAI、Microsoft、VentureBeat、ARC Prize、Hacker News、GitHub Trending 等公开来源。