📋 最新日报

🔥 今日看点

  • OpenAI 正式发布 GPT-6 Astra:Brockman 在发布会结尾高调宣布”欢迎来到 AGI 时代”,模型主打像人一样操作电脑的多步工作流;API 定价 $10/$50 每百万 token,登 HN 榜首获 1223 分
  • 微软 MAI-Transcribe-2 以 $0.10/小时早鸟价入场,较上代直降 72%,60 语言 FLEURS 登顶,语音转写价格战白热化
  • 阿里 Qwen 3.8 27B 上线 Cerebras 推理,实测约 1500 token/s,主打 Agentic 编码的多模态 27B 稠密模型
  • ChatGPT、Claude、Grok 三大服务同日集体宕机数小时引发 518 条讨论;ARC Prize 独立实测 Astra 标准 harness 仅 62.7%,”98.6% ARC-AGI-3”之争升温

📰 模型与产品动态

1. OpenAI 发布 GPT-6 Astra:最强的”电脑操作员”模型,宣告 AGI 时代

GPT-6 Astra 是 OpenAI 迄今最大规模训练(Stargate 超 10 万 DBU,首次由前代模型监督训练下一代),定位”世界最好的 computer use 模型”:无需为每个应用写 API 集成,直接像人一样操作浏览器、表格、桌面软件,语音即可完成做 3D 游戏、上架 eBay 等多步任务。OSWorld 2.0 离线子集 72.6%(单任务约 40 分钟),较 GPT-5.6 Sol 的 65.7%/75 分钟快约 47%;FrontierMath Tier 4 v2 97.6%、DeepSWE v1.1 74.1%(最高配置每任务 API 成本低约 57%)、自测 ARC-AGI-3 98.6%。API 名 gpt-6-astra,标准价 $10/$50 每百万 token,支持 Zero Data Retention。经 Daybreak 门控计划先行开放,随后铺向 ChatGPT 全系、API、AWS Bedrock 与 Azure。Brockman 强调企业应看”每完成任务价格”而非 token 单价。
官方发布 · VentureBeat · HN 讨论

2. ARC Prize 独立实测 Astra:62.7% 还是 99.9%,取决于 harness

ARC Prize 官方在发布当日给出独立评测:GPT-6 Astra(max)在标准 harness 下 ARC-AGI-3 Semi-Private 得分 62.7%(成本 $26K),而用 Provider Adapter harness 高达 99.9%($19K),均为当前 SOTA。更引人注目的是行为层面:Astra 在 96% 的关卡中比人类中位数用更少动作解出谜题,能把陌生环境抽象成符号世界模型并自创 DSL 速记来规划。这与 NVIDIA 8 月 AVO 的结论一致——长时程智能来自完整 Agent 系统而非模型本身,也让”98.6% 是否等于 AGI”的争论有了更扎实的注脚。
ARC Prize 分析 · HN 讨论

3. 微软 MAI-Transcribe-2:$0.10/小时,把转写打成”不值得争论的账单”

微软 AI 自研语音模型更新:早鸟价 $0.10/小时音频(5 个月前初代 $0.36,直降约 72%),支持 60 种语言(初代 25 → 1.5 代 43)。基础价即捆绑说话人分离、词级时间戳、关键词偏置、自动语种识别、verbatim/clean 双输出风格与 Hinglish/Spanglish 等语内混切——这些过去都是专业厂商的付费项。FLEURS 60 语平均 WER 5.2% 居首,Artificial Analysis 词错率榜第二并定义”精度-延迟帕累托前沿”。已上线 Microsoft Foundry 与 MAI Playground,并开始替换 Copilot Voice、Teams 里的第三方/旧模型,是微软逐模态自研、摆脱对 OpenAI 依赖的最清晰信号。
阅读全文

4. 阿里 Qwen 3.8 27B 上线 Cerebras:约 1500 token/s 的 Agentic 编码模型

Qwen 3.8 系列新旗舰 27B 稠密多模态模型上线 Cerebras 公共端点:实测约 1500 token/s(免费档上下文 64k,付费档 128k,最大输出 40k),支持文本+图像输入与可配置推理,面向 Agentic 编码、工具调用、研究类长程任务。Cerebras 端定价 $0.99/$1.49 每百万 token(输入/输出),登 HN 获 427 分。社区关注点在于:接近 GPT-5.6 Sol max 级别智能指数(61)的开放模型,配合每秒上千 token 的推理速度,本地与实时 Agent 场景的门槛再次被拉低。
Cerebras 模型页 · HN 讨论

5. IFM 开源 K2 Horizon:六模型”舰队”,史上最彻底的开源发布

Institute of Foundation Models 发布 K2 Horizon 模型舰队:375B-A23B、36B-A4B、32B、7B、3.7B、0.9B 六个模型一次放出,其中 0.9B/3.7B/7B 在各自量级刷新 SOTA(0.9B AIME 2026 超 48 分),36B-A4B 用新的 MoVA(Mixture-of-Value-Attention)稀疏注意力架构实现接近 32B 稠密模型的性能。全部 Apache 2.0,并开放从预训练到后训练的全生命周期:中间 checkpoint、数据配方、训练代码、日志与评测结果,覆盖边缘设备到企业场景。被评价为”迄今最全面的开源模型发布”,HN 讨论 242 分。
官方博客 · HN 讨论


🌐 Hacker News 热门讨论

6. ChatGPT、Claude、Grok 同日集体宕机:基础设施级联故障?(322 分)

OpenAI、Anthropic、xAI 的服务在相近时间窗口集体故障数小时(各自状态页均标记 Resolved,三个独立讨论帖合计 600+ 评论)。HN 用户观察到 Cloudflare、Azure、AWS、Google Cloud 的错误上报在约 7:30 PT 同步攀升,猜测是公共基础设施层故障级联到依赖方;也有观点指出 Downdetector 数据以搜索量为代理、可能放大恐慌。值得注意的是 Gemini 全程未受影响。事件再次把”AI 供应链单一故障点”问题摆上台面——当所有大模型都架在同一批云与 CDN 上,同时宕机可能不再是巧合。
HN 讨论

7. Google Antigravity 服务条款争议:第三方使用可能导致 Google 账号被暂停(269 分)

Gergely Orosz 发文指出 Google Antigravity(Google 的 Agentic IDE)服务条款中,使用第三方工具/服务的行为可能触发 Google 账号暂停,开发者担心平台账号与 AI 开发工具深度绑定的风险。评论区多位用户报告 AI Pro 订阅配额更新延迟、无解释限制等问题,讨论延伸至”工具链锁定 vs 账号安全”的边界、条款可读性以及 Google 客服黑洞。对把 Antigravity 纳入工作流的开发者是重要提醒:读条款、隔离账号、避免把生产凭据绑在消费级账号上。
HN 讨论

8. 实测 17,000 次运行:Claude、Codex、Cursor 究竟会安装哪些工具?(73 分)

Armature 团队公布对三大编码 Agent 的 17k 次运行观测:统计它们在真实任务中主动安装/调用的工具链(语言服务器、格式化器、测试框架、MCP 服务器等)。数据揭示各家 Agent 的工具偏好与”默认行为”差异显著——例如某些 Agent 更倾向自写脚本而非装现成 CLI,直接影响任务耗时与成功率。对 Agent 工具链开发者来说,这类”行为测量”比 benchmark 分数更能指导产品设计:与其猜 Agent 会用什么,不如直接看它 17,000 次里实际做了什么。
报告 · HN 讨论


9. anthropics/skills:Anthropic 官方 Agent Skills 仓库上榜(+281★ 今日)

Anthropic 官方维护的 Agent Skills 公共仓库(累计 17.4 万星)。Agent Skills 正在成为 Claude Code/Codex 等工具的标准能力封装单位,官方仓库的上榜标志着”技能生态”从社区自发走向平台官方治理——开发者可以直接复用官方验证过的技能定义,而不是各自发明格式。
仓库

10. obra/superpowers:把”技能”做成一套开发方法论(+462★ 今日)

Jesse Vincent(Obra)开源的 agentic skills 框架与软件开发方法论(累计 28.1 万星):不只是零散技能包,而是配套完整开发流程的技能体系。它在 Trending 上与 anthropics/skills、mattpocock/skills 等仓库同屏出现,说明”给 Agent 装备可复用技能”正从个人技巧演变为团队级工程实践。
仓库

11. affaan-m/ECC:面向多 Agent 的 harness 性能优化系统(+751★ 今日)

ECC 定位为”Agent harness 性能优化系统”:把技能、本能(instincts)、记忆、安全与研究优先开发整合为一套配置,横跨 Claude Code、Codex、Opencode、Cursor 等多个前端(累计 24.7 万星)。随着企业同时跑多个编码 Agent,跨工具的标准化”驾驶舱”需求正在催生新的工具品类。
仓库

12. blader/humanizer:给 Agent 输出”去 AI 味”的技能(+1,208★ 今日)

一个颇具争议却快速走红的 Agent 技能:从文本中移除 AI 生成痕迹(累计 4.1 万星,今日 +1.2k)。走红本身即是信号——当 AI 写作大规模进入工作流,”机器味”已成为真实的生产力成本,无论用于内容合规还是个人表达,这类后处理技能正在变成 Agent 流水线的标准一环。
仓库

13. magnitudedev/magnitude:接进你现有 Agent 的开源本地推理服务器(+161★ 今日)

开源推理服务器:针对本机硬件跑最优本地模型,并直接”插进”你正在用的 Agent——兼容 Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Cline 等(累计近 2 千星,今日 +161)。与 Cerebras 等云端高速推理形成互补:本地派 Agent 用户想要的是”模型可换、Agent 不变”的私有化自由。
仓库


本日报由 TimLake AI 编辑自动采集整理,数据来自 OpenAI、Microsoft、VentureBeat、ARC Prize、Hacker News、GitHub Trending 等公开来源。

GPT-6 Astra 发布:OpenAI 宣告进入 AGI 时代 | 微软语音转写杀至 $0.10/小时 | Qwen 3.8 上线 Cerebras 1500 tok/s | OpenAI/Claude/Grok 集体宕机引热议

🔥 今日看点 OpenAI 正式发布 GPT-6 Astra:Brockman 在发布会结尾高调宣布”欢迎来到 AGI 时代”,模型主打像人一样操作电脑的多步工作流;API 定价 $10/$50 每百万 token,登 HN 榜首获 1223 分 微软 MAI-Transcribe-2 以 $0.10/小时早鸟价入场,较上代直降 72%,60 语言 FLEURS 登顶,...

AI日报

Gemini 3.8 Flash 与 Cyber 发布 | Meta Muse Spark 1.3 + 0.18美元语音转写 | Fable 5.1 Agent 自动建模开源 | Agent 工具链霸榜 GitHub

🔥 今日看点 Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber:六周内第三个 Flash 版本,长时程编码与 Agent 能力逼近更大杯前沿模型;Cyber 版漏洞挖掘/自动修补达前沿水平,经 Fairwind 计划定向开放给受信防御者 Meta 连发两款 Muse 模型:Spark 1.3 主打 Agent 工作流与竞技编程;Voice ...

AI日报

Claude Fable 5.1 缓存降价75% | OpenAI Astra 强化网络安全 | Perplexity 混合计算落地 | OpenClaw 2.0 多人编码

🔥 今日看点 Anthropic 发布 Claude Fable 5.1 / Mythos 5.1:缓存读取降价 75%($1.00 → $0.25/百万 token),长时 Agent 任务成本大降,并推出 Enterprise Frontier Safeguards 企业安全架构 OpenAI 发布 Path to Astra 路线图:新模型 Astra 在 Exp...

AI日报

GLM-5.3-Flash揭晓Ox Alpha身份,Nvidia 35亿美元押注MediaTek定制芯片,Apple遭AI硬件需求冲击,Agent技能生态持续爆发

🔥 今日看点 GLM-5.3-Flash 身份揭晓:就是上周刷屏 OpenRouter 的谜之模型 Ox Alpha,全程中文芯片推理,价格仅为美国同级模型约 1/7 Nvidia 宣布 35 亿美元投资联发科 MediaTek,把 NVLink Fusion 生态开放给定制 AI 芯片,对冲大厂自研芯片浪潮 Apple 被 AI 硬件需求打个措手不及:Mac Mini 与 Ma...

AI日报

Meta 8B模型匹敌Claude Opus 4.5 | Salesforce把CRM装进Claude | Perplexity联手Nvidia推全本地Agent | Anthropic发布硬件操作标准

🔥 今日看点 Meta 研究者发布 EvoHarness-RL:8B 小模型在 Agent 任务上匹敌 Claude Opus 4.5,成本大幅下降 Salesforce 与 Anthropic 宣布 Claudeforce:整个 CRM 装进 Claude CoWork,37 个预置销售技能 Perplexity 联手 Nvidia 推出 Portable Computer:完全本地运行...

AI日报

腾讯开源Hy4(770B MoE)登顶HN | vLLM 0.28深度优化Kimi-K3 | GLM-5.3-Flash或承接45%推理负载 | Agent技能生态爆发

🔥 今日看点 腾讯发布并开源 Hy4 preview:770B 总参数 MoE、超 100 万 token 上下文,登顶 HN(164 分) vLLM v0.28.0 发布:Kimi-K3 与 DeepSeek V4 推理栈深度优化,584 个 commit GLM-5.3-Flash 被指可承接 45% 推理负载:中美推理成本战进入白热化 GitHub Trending:科学 Agent...

AI日报

Nvidia 130亿美元收购Hugging Face落定 | GLM-5.3权重正式开源 | Perplexity推出本地Agent | Meta 8B模型追平Claude Opus 4.5

🔥 今日看点 Nvidia 与 Hugging Face 达成 130 亿美元收购协议,从传闻到落定,登顶 HN(1947 分) GLM-5.3 主模型权重正式开源(MIT),继 Flash 之后 Z.ai 全面拥抱开放生态 Perplexity 联手 Nvidia 发布 Portable Computer:完全本地运行的 AI Agent,token 成本归零 Meta EvoHarne...

AI日报

Nvidia 拟$13B收购Hugging Face | GLM-5.3-Flash认领Ox Alpha身份 | Anthropic发布模型硬件标准MHS | Gemini 3.5 Transcribe上线

🔥 今日看点 Nvidia 被曝洽谈以超 130 亿美元收购 Hugging Face,或成芯片巨头史上最大交易之一,登顶 HN(1823 分) 神秘模型 Ox Alpha 身份揭晓:Z.ai 官宣其为 GLM-5.3-Flash,全程跑在中国芯片上,推理成本击穿底价 Anthropic 开放模型硬件标准(MHS)研究预览:为 AI Agent 安全操控物理设备立规范 Google 发布 ...

AI日报

GLM-5.3-Flash 以1/10价格逼近 Claude Opus 4.8 | Qwen 开源 Qwen4 架构预览 | Salesforce 把 CRM 装进 Claude | AWS 收购 DuckLabs

🔥 今日看点 智谱发布 GLM-5.3-Flash:320B/18B 原生多模态,价格仅 GLM-5.2 的 1/10,编码与 Agent 基准逼近 Claude Opus 4.8 通义千问开源 Qwen3.8-Flash-Next:Qwen4 架构公开预览,训练成本仅为 Qwen3.7-Plus 的 1/9 Salesforce 与 Anthropic 官宣...

AI日报

Perplexity联手英伟达推全本地AI Agent零Token成本 | OpenAI自研芯片Jalapeño引热议 | 苹果M6/M5 Ultra主打AI算力 | Claude Code插件生态升温

🔥 今日看点 Perplexity 联手 Nvidia 发布 Portable Computer:模型、文件、工作全部留在本地设备,零 token 成本,任务默认本地启动 SemiAnalysis 评测称 OpenAI 自研芯片 Jalapeño 性能超越 Nvidia Blackwell,登顶 HN 热榜(293 分) Apple 发布 M6 与 M5 Ultra 芯片及新 Mac St...

AI日报
123411