头条看点
Poolside 发布 Laguna S 2.1:118B 开源编码模型击败 10 倍大对手
旧金山 AI 实验室 Poolside 今日发布 Laguna S 2.1,一款 1180 亿参数的 MoE 模型(每次仅激活 80 亿参数),支持 100 万 token 上下文窗口。在 Terminal-Bench 2.1 上得分 70.2%,超越 DeepSeek-V4-Pro-Max(1.6T 参数,64.0 分)、Thinking Machines Inkling(975B,63.8 分)和 NVIDIA Nemotron 3 Ultra(550B,56.4 分)。SWE-Bench Multilingual 得分 78.5%,SWE-Bench Pro 达 59.4%。
该模型从 5 月 22 日开始预训练到公开发布仅用 9 周,在 4096 张 H200 GPU 上完成。Poolside 将其定位为”西方开源模型的回应”——过去 11 个月西方没有实验室发布过该尺寸级别的开源权重。定价极具攻击性:输入 $0.10/M token,输出 $0.20/M token。已在 Hugging Face 以 OpenMDW-1.1 许可发布,同步上线 Baseten 和 Vercel AI Gateway。
cursor.com/blog | venturebeat.com
Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber
Google DeepMind 一次性推出三款 Gemini Flash 系列新模型。Gemini 3.6 Flash 定位最高性能的 Flash 模型;3.5 Flash-Lite 面向低成本、低延迟场景优化;3.5 Flash Cyber 则首次引入针对网络安全场景的专用变体。此次发布还伴随 Gemini 3.5 Flash 的”Computer Use”功能——让模型可以直接操控计算机界面执行任务。同批发布的还有 Nano Banana 2 Lite 和 Gemini Omni Flash 等轻量级模型,进一步扩展了从端侧到云端的模型矩阵。
在 HN 上引发 593 分、472 条评论的热烈讨论,开发者对新模型的性价比和安全能力尤为关注。
Jack Dorsey 发布 Buzz:开源 AI 团队协作平台
Block(原 Square)创始人 Jack Dorsey 宣布推出 Buzz,一个将团队聊天、AI Agent、Git 代码托管和工作流自动化融合为一体的开源工作空间。Buzz 基于 Nostr 协议构建,每条消息、代码事件和审批都存储为加密签名事件。AI Agent 拥有与人类员工相同的身份结构(密钥对、频道成员资格、审计轨迹),可搜索历史讨论、提交代码补丁、运行工作流。
Buzz 当前版本 v0.4.21,支持频道、私信、共享画板、YAML 工作流和桌面应用(macOS/Windows/Linux)。支持 Goose、Codex 和 Claude Code 等 Agent 框架。项目在 GitHub 以 Apache 2.0 许可开源,但 Dorsey 坦诚目前仍处于早期阶段,移动端和推送通知等尚在开发中。
HN 上获 221 分、202 条评论,开发者对 “Slack + GitHub + AI Agent” 一体化的理念反响热烈。
github.com/block/buzz | runtimewire.com
模型与平台动态
Kimi K3 达到与 Anthropic Fable 竞争水平
Fireworks AI 发布博文称,Moonshot AI 的 Kimi K3 模型在与 Anthropic 的 Fable 系列对比中展现出强劲竞争力,在多项基准测试中达到接近或持平的水平。Fireworks 已将 Kimi K3 和 Fable 共同列为当前 SoTA(最佳水平)模型。这标志着中国 AI 实验室在基础模型能力上持续缩小与西方前沿模型的差距。
OpenAI 与 Hugging Face 联合处理模型评估安全事件
据 HN 头条报道(614 分/415 评论),OpenAI 和 Hugging Face 在处理一次模型评估过程中的安全事件时展开合作。目前具体细节有限,但事件涉及在模型评估和测试环节中出现的潜在安全问题。两家机构已采取措施防范类似事件再次发生。
ChatGPT 开始投放广告
OpenAI 宣布将在 ChatGPT 中引入广告位,企业可以在对话式 AI 界面中投放广告。该举措标志着 OpenAI 商业化战略的重要扩展,也引发了社区关于 AI 产品中广告体验和隐私问题的广泛讨论(HN 264 分/268 评论)。
AI IDE 与开发者工具
Cursor 研究博客:Agent 集群与模型新经济学
Cursor 团队研究员 Wilson Lin 发表长文(17 分钟阅读),探讨 Agent 集群(Agent Swarms)如何重塑模型经济。文章认为随着 Agent 之间协作的加深,模型的选择不再仅看单次推理成本或单一基准得分,而是需要考量 Agent 集群的整体运行成本和协作效率。这为编码 Agent 的未来架构设计提供了新视角。
Anthropic 发布《Claude Code 诞生记》
Anthropic 发布深度文章《The Making of Claude Code》,由参与构建 Claude Code 的研究人员、工程师和早期用户讲述这款编码 Agent 从内部 CLI 工具发展为 Anthropic 核心产品的历程。文章透露了 Claude Code 在设计决策、技术架构和产品化过程中的关键思考。
GitHub 趋势项目
ai-agent-book(⭐ 14,406 / 今日 +4,624)
李博杰著《深入理解 AI Agent:设计原理与工程实践》开源主仓库,包含全书正文、编译版 PDF 与按章配套代码。今日 GitHub 上最热门的 AI 项目之一。
github.com/bojieli/ai-agent-book
code-review-graph(⭐ 24,534 / 今日 +1,925)
本地优先的代码智能图,专为 MCP 和 CLI 设计。构建代码库的持续映射,让 AI 编码工具只读取相关上下文,在大型仓库代码审查中已有基准测试验证的上下文缩减效果。
github.com/tirth8205/code-review-graph
jcode(⭐ 10,303 / 今日 +843)
Rust 编写的”最智能 Agent 编码工具”,定位为编码 Agent 的增强框架。
i-have-adhd(⭐ 6,842 / 今日 +1,866)
为编码 Agent 设计的技能包,防止 Agent 在回答中”埋藏”答案,输出更适合 ADHD 人群的简洁格式。社区反响热烈。
text-to-cad(⭐ 9,105 / 今日 +291)
面向 CAD、机器人和硬件设计的 Agent 技能集合,让 Agent 能够理解和生成 CAD 操作。
github.com/earthtojake/text-to-cad
行业研究报告
VentureBeat AI 控制差距系列报告
VentureBeat 本周发布四份《AI 控制差距》调查系列报告(各调研 100+ 企业),核心发现:
Agent 安全差距:54% 的企业已遭遇 AI Agent 安全事件(18% 确认事故,36% 险情)。仅 32% 为每个 Agent 分配独立身份,多数 Agent 共享凭证。只有 30% 的企业对高风险 Agent 进行沙箱隔离。
AI 计算差距:企业 AI 基础设施支出远超其衡量成本的能力。GPU 利用率不到 50%,不到半数企业能准确追踪计算成本。
AI 上下文差距:RAG 已成为默认上下文来源,但过半数企业已观察到 Agent 因上下文缺失或矛盾而产生自信的错误答案。
Agent 评估差距:50% 的企业曾上线通过内部评估但在客户面前失败的 Agent。仅 5% 完全信任自动化评估。但三分之二的企业仍允许仅凭自动化评估就部署 Agent 变更。
快速摘要
| 领域 | 事件 | 热度/评级 |
|---|---|---|
| 🏆 模型 | Poolside Laguna S 2.1 开源发布,9 周训练击败大 10 倍模型 | 🔥🔥🔥🔥🔥 |
| 🏆 模型 | Google Gemini 3.6 Flash / 3.5 Flash-Lite / 3.5 Flash Cyber 发布 | 🔥🔥🔥🔥🔥 |
| 🧰 工具 | Jack Dorsey 发布 Buzz 开源 AI 办公平台(Slack+Git+Agent 一体) | 🔥🔥🔥🔥 |
| 🧰 工具 | ChatGPT 引入广告位,OpenAI 商业化再拓展 | 🔥🔥🔥 |
| 🧪 研究 | Kimi K3 与 Anthropic Fable 并列为 SoTA | 🔥🔥🔥 |
| 📊 报告 | VentureBeat AI 控制差距:54% 企业已遭遇 Agent 安全事件 | 🔥🔥🔥🔥 |
| 🧰 IDE | Cursor 发布 Agent 集群与模型经济学研究 | 🔥🔥🔥 |
| 📚 开源 | ai-agent-book(今日 +4,624⭐)、code-review-graph 火爆 | 🔥🔥🔥 |