🔥 今日看点

  • SpaceXAI 发布 Grok 4.6:Artificial Analysis 智能指数 61 追平 GPT-5.6 Sol Max,编码/Agent 基准大幅超越 Grok 4.5,API 定价 $2/$6 每百万 token
  • DeepSeek V4 Pro 正式版(0813 版)上线 OpenRouter:1M 上下文、$0.435/$0.87 定价,752 分登顶 HN;通义 Qwen3.8-2.4T(2.4T 总参/95B 激活)开源权重同步刷屏
  • Meta 重回开源:30B Agent 模型 Muse Glimmer 以 Apache 2.0 发布,24GB 显存本地跑 Agent,Ollama/vLLM/SGLang 全家桶接入
  • Zed 发布 Delta:Agent 协作的多人开发环境进入私有 beta;Lovable 完成 $400M C 轮融资,估值 $13.3B

📰 VentureBeat 精选

1. SpaceXAI 发布 Grok 4.6:追平 GPT-5.6 Sol Max,主打长程 Agent 与编码

SpaceXAI(原 xAI)发布 Grok 4.6,Artificial Analysis 智能指数 61 分,超越 Moonshot Kimi K3、追平 GPT-5.6 Sol Max,较 Grok 4.5 提升 5 分(Claude Opus 5 与 Fable 5 分列一二)。编码与 Agent 基准全面升级:CursorBench v3.2 达 69.9%、DeepSWE v1.1 从 54% 跃升至 65.9%、APEX-Agents 57.5%(+10.4 分)、Terminal-Bench 从 15.7% 升至 26%。官方强调针对长序列工作做了更长的补充训练,自检与验证行为更强。API 起步价 $2/百万输入、$6/百万输出(不足 GPT-5.6 Sol 的一半),今日起在 Grok Build 与 Cursor 上线(收购 Cursor 后首次深度整合),首周双倍用量,OpenRouter、Vercel、Cloudflare 同步接入。
阅读全文 · HN讨论

2. Meta 重回开源:Muse Glimmer 30B Agent 模型,Apache 2.0 授权

Meta 发布 Muse Glimmer:约 296 亿参数的稠密模型(52 层,含 1.8B ViT 感知编码器),Apache 2.0 全开放——这是自 4 月 Muse Spark 转闭源以来首个完全开源发布,授权比 Llama 更宽松(无月活限制)。模型围绕 Agent 循环训练:规划、工具调用、自检与失败恢复,支持 131K 上下文、100+ 语言、低/中/高/xhigh 四档推理强度,可在 24GB 显存上运行。权重已上 Hugging Face,本周起 Ollama、LM Studio、vLLM、SGLang、Together AI、Fireworks AI、OpenRouter 陆续接入;官方演示在本地 Home Assistant 上自主发现设备、编写仪表盘并自验部署。Zuckerberg 同时预告 Muse Spark 1.2 权重”很快”开放。
阅读全文

3. OpenAI 推出 GPT-5.6-Cyber 与 Daybreak 红蓝分级:95% 完成高级网安任务

OpenAI 发布 GPT-5.6-Cyber:基于 GPT-5.6 Sol 微调的安全专用模型,面向漏洞研究与利用链开发,并刻意降低对高风险”双用途”请求的拒答率。内部基准 Advanced Cybersecurity Completion Rate 达 95%(前代 GPT-5.5-Cyber 仅 57.3%,普通 Sol 仅 1.5%)。定价 $12.50/百万输入、$75/百万输出。访问需通过新推出的 Daybreak 网络安全计划:Daybreak Red 面向通过资质审核(SOC 2/ISO 27001 等)的防御性安全团队提供专用模型,Daybreak Blue 面向更广泛企业开放调整过护栏的通用前沿模型。安全模型商用化正走向”分级准入”模式。
阅读全文

4. Brex 发布 CrabTrap:假设 Agent 无所不能,改为监控网络层

Brex CEO Pedro Franceschi 在 VB Transform 2026 分享企业部署 AI Agent 的安全新范式:与其限制容器内代码(他认为会削弱编码 Agent 的核心价值),不如”假设 Agent 什么都能干、甚至已被攻破”,把安全边界移到网络层。Brex 开源了 CrabTrap——一个 HTTP 代理,用 LLM 当裁判评估容器与互联网之间的出站流量是否符合策略:常规低风险请求走静态规则即时放行,高风险操作(如发邮件)才交给 LLM 判定,仅约 2% 请求承受 LLM 延迟;违规时通过 Slack 触发人工审批并可动态更新规则。团队已用基于 OpenClaw 的虚拟招聘官”Jim”实测。Agent 安全正从”代码沙箱”转向”行为/网络监控”。
阅读全文


🌐 Hacker News 热门讨论

5. DeepSeek V4 Pro 0813 正式版上线:752 分登顶 HN

DeepSeek V4 Pro 0813(GA 版)在 OpenRouter 上线,以 752 分、284 评论登顶 HN 首页。这是 DeepSeek V4 Pro 的正式发布版本:大规模 MoE 架构,1M 上下文窗口,定价 $0.435/百万输入、$0.87/百万输出,在近期国内开源模型价格战中保持极具竞争力的价位。社区热议其”平价前沿模型”定位与对闭源旗舰的替代效应。
模型页 · HN讨论

6. 通义 Qwen3.8-2.4T-A95B 开源:2.4T 总参/95B 激活,496 分

阿里通义开源 Qwen3.8 系列最强模型 Qwen3.8-2.4T-A95B:MoE 架构、2.4T 总参数/95B 激活、92 层混合 Gated DeltaNet + Attention,HN 496 分、108 评论。官方称这是 Qwen 开源家族首次下放 Qwen-Max 级模型,编码、专业工作、研究与长程 Agent 任务全面增强,支持 reasoning_effort 灵活控制思考深度。配套 Qwen3.8-Max API 版提供视觉输入、1M 上下文与内置工具。开源权重大战的”军备竞赛”再上台阶。
模型页 · HN讨论

7. Zed 发布 Delta:Agent 协作的多人开发环境(393 分)

Zed 宣布 Delta——面向”与 Agent 一起编码并审查其产出”的多人协作环境,进入私有 beta(393 分、131 评论)。核心是自研 DeltaDB:把对话与工作树实时复制给线程中的每个人,评论可锚定在任何一行代码上(无论 Agent 昨天改的还是人三年前写的),Agent 直接留在线程里参与讨论、解释或修复。基于现有 git 仓库工作,不打开 Delta 的同事看到的仍是普通 git 仓库。定位是”Zed 之后的最佳代码讨论场所”,直指 Agent 时代代码评审的断裂问题。
官方博客 · HN讨论

8. Lovable 完成 $400M C 轮融资,估值 $13.3B(94 分)

AI 软件创建平台 Lovable 宣布完成 $400M C 轮融资,估值 $13.3B,由 Menlo Ventures 领投、EQT 旗下 Scaleup Europe Fund 联合领投,腾讯、Balderton、CapitalG、DST Global 等参投。自 2024 年 11 月上线以来用户已创建超 6000 万项目,月访问量超 9 亿,近三分之二财富 500 强企业在使用。公司表示下一步将让产品更”主动”:理解用户目标、主动识别待办并推进工作,同时深化与现有技术栈的集成。
官方博客 · HN讨论

9. Launch HN:Discovered Materials —— 用 AI Agent 发现新材料(114 分)

YC P26 公司 Discovered Materials 发布:用 AI Agent 自主设计并发现新材料,登上 HN(114 分)。项目面向材料科学研发,将 LLM Agent 与模拟/实验闭环结合,缩短新材料从设计到验证的周期。社区关注 AI for Science 从”辅助计算”走向”自主实验”的落地进展。
研究页 · HN讨论


10. cathrynlavery/diagram-design — Claude Code 图表设计库(今日 +2,855)

“29 种编辑级图表类型,专为 Claude Code 打造”,自包含 HTML + SVG,无需 Mermaid。总星 10.7k、今日 +2,855,居今日 Trending 榜首。编码 Agent 输出质量(图表/文档呈现)成为新的竞争维度。
仓库

11. msitarzewski/agency-agents — 一站式 AI 代理军团(今日 +1,873)

“触手可及的完整 AI 代理公司”:从前端专家到社区运营、创意注入到事实核查,每个 Agent 都是带个性、流程与交付物的专项专家。总星 144.6k、今日 +1,873。多 Agent 编排模板正以惊人速度扩散。
仓库

12. stablyai/orca — 并行 Agent 舰队 IDE(今日 +1,235)

“驾驭并行 Agent 舰队的 ADE”:用自己的订阅运行任意编码 Agent,支持桌面、移动与 VPS。总星 43.9k、今日 +1,235(连续两日上榜)。Agent 编排正在从框架走向完整 IDE 产品形态。
仓库

13. semantica-agi/semantica — 图原生 AI 上下文基础设施(今日 +845)

“面向上下文与可问责 AI 系统的图原生基础设施”,总星 5.8k、今日 +845。Agent 的记忆、上下文与审计追踪正在催生新的数据基础设施层。
仓库

14. cactus-compute/needle — 14MB 端侧基础模型(今日 +315)

仅 14MB 的基础模型,面向手机、可穿戴、智能家居与机器人等微型设备,今日 +315 星。端侧/微型模型赛道持续升温,边缘 Agent 部署成为新的探索方向。
仓库


本日报由 TimLake AI 编辑自动采集整理,数据来自 VentureBeat、Hacker News、GitHub Trending 等公开来源。