头条看点

Poolside 发布 Laguna S 2.1:118B 开源编码模型击败 10 倍大对手

旧金山 AI 实验室 Poolside 今日发布 Laguna S 2.1,一款 1180 亿参数的 MoE 模型(每次仅激活 80 亿参数),支持 100 万 token 上下文窗口。在 Terminal-Bench 2.1 上得分 70.2%,超越 DeepSeek-V4-Pro-Max(1.6T 参数,64.0 分)、Thinking Machines Inkling(975B,63.8 分)和 NVIDIA Nemotron 3 Ultra(550B,56.4 分)。SWE-Bench Multilingual 得分 78.5%,SWE-Bench Pro 达 59.4%。

该模型从 5 月 22 日开始预训练到公开发布仅用 9 周,在 4096 张 H200 GPU 上完成。Poolside 将其定位为”西方开源模型的回应”——过去 11 个月西方没有实验室发布过该尺寸级别的开源权重。定价极具攻击性:输入 $0.10/M token,输出 $0.20/M token。已在 Hugging Face 以 OpenMDW-1.1 许可发布,同步上线 Baseten 和 Vercel AI Gateway。

cursor.com/blog | venturebeat.com

Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

Google DeepMind 一次性推出三款 Gemini Flash 系列新模型。Gemini 3.6 Flash 定位最高性能的 Flash 模型;3.5 Flash-Lite 面向低成本、低延迟场景优化;3.5 Flash Cyber 则首次引入针对网络安全场景的专用变体。此次发布还伴随 Gemini 3.5 Flash 的”Computer Use”功能——让模型可以直接操控计算机界面执行任务。同批发布的还有 Nano Banana 2 Lite 和 Gemini Omni Flash 等轻量级模型,进一步扩展了从端侧到云端的模型矩阵。

在 HN 上引发 593 分、472 条评论的热烈讨论,开发者对新模型的性价比和安全能力尤为关注。

blog.google

Jack Dorsey 发布 Buzz:开源 AI 团队协作平台

Block(原 Square)创始人 Jack Dorsey 宣布推出 Buzz,一个将团队聊天、AI Agent、Git 代码托管和工作流自动化融合为一体的开源工作空间。Buzz 基于 Nostr 协议构建,每条消息、代码事件和审批都存储为加密签名事件。AI Agent 拥有与人类员工相同的身份结构(密钥对、频道成员资格、审计轨迹),可搜索历史讨论、提交代码补丁、运行工作流。

Buzz 当前版本 v0.4.21,支持频道、私信、共享画板、YAML 工作流和桌面应用(macOS/Windows/Linux)。支持 Goose、Codex 和 Claude Code 等 Agent 框架。项目在 GitHub 以 Apache 2.0 许可开源,但 Dorsey 坦诚目前仍处于早期阶段,移动端和推送通知等尚在开发中。

HN 上获 221 分、202 条评论,开发者对 “Slack + GitHub + AI Agent” 一体化的理念反响热烈。

github.com/block/buzz | runtimewire.com


模型与平台动态

Kimi K3 达到与 Anthropic Fable 竞争水平

Fireworks AI 发布博文称,Moonshot AI 的 Kimi K3 模型在与 Anthropic 的 Fable 系列对比中展现出强劲竞争力,在多项基准测试中达到接近或持平的水平。Fireworks 已将 Kimi K3 和 Fable 共同列为当前 SoTA(最佳水平)模型。这标志着中国 AI 实验室在基础模型能力上持续缩小与西方前沿模型的差距。

fireworks.ai/blog

OpenAI 与 Hugging Face 联合处理模型评估安全事件

据 HN 头条报道(614 分/415 评论),OpenAI 和 Hugging Face 在处理一次模型评估过程中的安全事件时展开合作。目前具体细节有限,但事件涉及在模型评估和测试环节中出现的潜在安全问题。两家机构已采取措施防范类似事件再次发生。

openai.com

ChatGPT 开始投放广告

OpenAI 宣布将在 ChatGPT 中引入广告位,企业可以在对话式 AI 界面中投放广告。该举措标志着 OpenAI 商业化战略的重要扩展,也引发了社区关于 AI 产品中广告体验和隐私问题的广泛讨论(HN 264 分/268 评论)。

ads.openai.com


AI IDE 与开发者工具

Cursor 研究博客:Agent 集群与模型新经济学

Cursor 团队研究员 Wilson Lin 发表长文(17 分钟阅读),探讨 Agent 集群(Agent Swarms)如何重塑模型经济。文章认为随着 Agent 之间协作的加深,模型的选择不再仅看单次推理成本或单一基准得分,而是需要考量 Agent 集群的整体运行成本和协作效率。这为编码 Agent 的未来架构设计提供了新视角。

cursor.com/blog

Anthropic 发布《Claude Code 诞生记》

Anthropic 发布深度文章《The Making of Claude Code》,由参与构建 Claude Code 的研究人员、工程师和早期用户讲述这款编码 Agent 从内部 CLI 工具发展为 Anthropic 核心产品的历程。文章透露了 Claude Code 在设计决策、技术架构和产品化过程中的关键思考。

anthropic.com/news


GitHub 趋势项目

ai-agent-book(⭐ 14,406 / 今日 +4,624)

李博杰著《深入理解 AI Agent:设计原理与工程实践》开源主仓库,包含全书正文、编译版 PDF 与按章配套代码。今日 GitHub 上最热门的 AI 项目之一。

github.com/bojieli/ai-agent-book

code-review-graph(⭐ 24,534 / 今日 +1,925)

本地优先的代码智能图,专为 MCP 和 CLI 设计。构建代码库的持续映射,让 AI 编码工具只读取相关上下文,在大型仓库代码审查中已有基准测试验证的上下文缩减效果。

github.com/tirth8205/code-review-graph

jcode(⭐ 10,303 / 今日 +843)

Rust 编写的”最智能 Agent 编码工具”,定位为编码 Agent 的增强框架。

github.com/1jehuang/jcode

i-have-adhd(⭐ 6,842 / 今日 +1,866)

为编码 Agent 设计的技能包,防止 Agent 在回答中”埋藏”答案,输出更适合 ADHD 人群的简洁格式。社区反响热烈。

github.com/ayghri/i-have-adhd

text-to-cad(⭐ 9,105 / 今日 +291)

面向 CAD、机器人和硬件设计的 Agent 技能集合,让 Agent 能够理解和生成 CAD 操作。

github.com/earthtojake/text-to-cad


行业研究报告

VentureBeat AI 控制差距系列报告

VentureBeat 本周发布四份《AI 控制差距》调查系列报告(各调研 100+ 企业),核心发现:

Agent 安全差距:54% 的企业已遭遇 AI Agent 安全事件(18% 确认事故,36% 险情)。仅 32% 为每个 Agent 分配独立身份,多数 Agent 共享凭证。只有 30% 的企业对高风险 Agent 进行沙箱隔离。

AI 计算差距:企业 AI 基础设施支出远超其衡量成本的能力。GPU 利用率不到 50%,不到半数企业能准确追踪计算成本。

AI 上下文差距:RAG 已成为默认上下文来源,但过半数企业已观察到 Agent 因上下文缺失或矛盾而产生自信的错误答案。

Agent 评估差距:50% 的企业曾上线通过内部评估但在客户面前失败的 Agent。仅 5% 完全信任自动化评估。但三分之二的企业仍允许仅凭自动化评估就部署 Agent 变更。

venturebeat.com


快速摘要

领域 事件 热度/评级
🏆 模型 Poolside Laguna S 2.1 开源发布,9 周训练击败大 10 倍模型 🔥🔥🔥🔥🔥
🏆 模型 Google Gemini 3.6 Flash / 3.5 Flash-Lite / 3.5 Flash Cyber 发布 🔥🔥🔥🔥🔥
🧰 工具 Jack Dorsey 发布 Buzz 开源 AI 办公平台(Slack+Git+Agent 一体) 🔥🔥🔥🔥
🧰 工具 ChatGPT 引入广告位,OpenAI 商业化再拓展 🔥🔥🔥
🧪 研究 Kimi K3 与 Anthropic Fable 并列为 SoTA 🔥🔥🔥
📊 报告 VentureBeat AI 控制差距:54% 企业已遭遇 Agent 安全事件 🔥🔥🔥🔥
🧰 IDE Cursor 发布 Agent 集群与模型经济学研究 🔥🔥🔥
📚 开源 ai-agent-book(今日 +4,624⭐)、code-review-graph 火爆 🔥🔥🔥