AI产品研发日报 | 2026年7月24日
📰 今日要闻
微软发布自研MAI系列模型,生产数据亮眼;OpenAI将GPT-Live全双工语音带入Codex和ChatGPT桌面端;Black Forest Labs推出FLUX 3多模态模型;Poolside发布开源编程模型Laguna S 2.1——以8B激活参数击败百亿级对手。
🔥 头条新闻
1. 微软自研MAI系列模型发布,成本最高降低89%
微软AI超级智能团队发布了两个新的自研模型——MAI-Image-2.5-Pro(顶级图像生成)和 MAI-Voice-2-Flash(企业级语音模型),同时公布了令人瞩目的生产部署数据。Bing Image Creator已完全基于MAI自研模型运行;PowerPoint中使用MAI模型相比GPT-Image-2降低84% GPU成本;Dynamics 365 Contact Center中使用MAI-Voice-2-Flash后GPU成本降低高达89%。Dragon Copilot已为170,000名医疗提供者处理2800万次患者交互,基于MAI-Transcribe-1.5实现58种语言转录。
2. OpenAI将GPT-Live全双工语音控制带入Codex和ChatGPT桌面端
距OpenAI推出具备全双工(同时听说)能力的GPT-Live音频AI模型仅两周,今日该能力已正式集成到ChatGPT桌面应用(macOS/Windows)中,与Codex和ChatGPT Work等Agent系统深度整合。开发者现在可以通过自然语音命令编排多线程编码任务、审查Pull Request、调试应用程序。桌面端还整合了”Appshots”屏幕上下文功能,使ChatGPT Voice能分析前台窗口、本地文件和代码结构。支持多项目工作区和iOS远程执行。
3. Black Forest Labs发布FLUX 3:图像+20秒视频+音频多模态生成
德国AI实验室Black Forest Labs推出FLUX 3,这是一个联合训练的多模态基础模型,能理解并生成图像、带音频的20秒视频,甚至扩展到机器人视觉和动作领域。FLUX 3提供四条产品线:FLUX 3 Video、FLUX 3 Image、FLUX 3 Action以及即将开源的FLUX 3 Dev。在内部评测中,FLUX 3在10秒720p文生视频+音频的偏好测试中分别以93%和77%的胜率超越Luma Ray 3.2和Runway Gen-4.5。目前仅开放限时Early Access申请,API和权重尚未公开。
🛠️ AI产品与平台
4. OpenAI推出Presence:企业级实时语音Agent部署平台
OpenAI发布Presence——面向企业客户的多渠道AI Agent部署与管理平台。Presence整合了企业知识、标准操作流程、安全控制、评估工具和升级规则,支持实时语音和聊天两种交互模式。每个Agent从定义好的任务开始(如处理账单问题、支持保险索赔),仅获得完成任务所需的信息和系统权限。在OpenAI自己的客服电话通道中,Presence已在无需人工干预的情况下解决75%的来电问题。Codex驱动的改进循环在10天内将人工转接率降低了15个百分点。
5. Poolside发布Laguna S 2.1:118B MoE开源编程模型,以8B激活参数击败千亿对手
旧金山AI实验室Poolside发布Laguna S 2.1——1180亿参数的混合专家(MoE)系统,每次激活仅80亿参数,支持100万token上下文窗口。模型在Terminal-Bench 2.1上得分70.2%,超越DeepSeek-V4-Pro-Max(1.6万亿参数,64.0分)。权重已开源,采用OpenMDW-1.1许可证,可在Hugging Face获取。从5月22日开始预训练到发布仅用9周,Poolside在三个月内交付了三款模型。
6. Echo:开源模型路由系统以1/3成本达到Fable级性能(Hacker News热门)
开发者adam_rida在HN上展示的Echo项目获得203分。Echo是一个模型路由系统,使用GLM-5.2、Kimi K2.7等开源模型的组合,通过动态分配计算资源和模型参与,在综合评测中持续优于池中任何单个模型,并且以约1/3的推理成本达到Anthropic Fable级别的聚合结果。已提供对话界面和兼容OpenAI的API。
7. Inflection AI回归消费市场,推出Pi Journeys
Inflection AI在经历微软整合风波后重返消费市场,推出Inflection AI Labs和首个产品实验Pi Journeys——一个根据用户人生阶段(成为父母、照护、职业转型、老龄化)自适应调整的AI体验。同时,旗舰聊天机器人Pi获得了语音、记忆、提醒、待办事项和购物等Agent工具的全面更新。
🧪 技术前沿
8. Google DeepMind:Gemini 3.6 Flash系列发布,计算机使用能力上线
DeepMind推出Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber三款新模型,同时在Gemini 3.5 Flash中加入了计算机使用(Computer Use)能力,使AI能直接操作桌面GUI。此外,DeepMind还发布了DiffusionGemma——通过扩散架构实现4倍于传统方法的文本生成速度的新模型。
9. Anthropic发布”Claude Code的诞生”幕后故事
Anthropic发布长篇特写,讲述Claude Code从内部CLI工具成长为Anthropic核心编程Agent产品的全过程。文章由参与构建的研究人员、工程师和早期用户共同讲述,展示了从原型到企业级产品的演进路径。
⭐ GitHub Trending 热门项目
| 项目 | 描述 | Stars | 今日新增 |
|---|---|---|---|
| koala73/worldmonitor | AI驱动的实时全球情报仪表盘,聚合新闻和地缘政治监控 | 71,583 | +3,175 |
| diegosouzapw/OmniRoute | 免费MIT AI网关,支持290+提供商、500+模型的统一API | 27,181 | +1,929 |
| block/buzz | 蜂群思维通信平台(Rust) | 6,892 | +2,162 |
| ComposioHQ/awesome-claude-skills | Claude Skills资源和工具精选列表 | 69,424 | +636 |
| shiyu-coder/Kronos | 金融市场基础模型(Python) | 33,049 | +401 |
| citrolabs/ego-lite | AI Agent与人类并行工作的浏览器 | 1,639 | +247 |
🔗 Hacker News 热点
Startup founders urge U.S. government not to shut off Chinese open weight AI (700 points, 627 comments) — 创业公司创始人敦促美国政府不要切断中国开源AI模型访问,引发关于开源AI地缘政治的激烈讨论。
Show HN: Echo – Fable-level results at 1/3 the cost using open-weight models (203 points) — 见上文第6条。
Show HN: Palmier Pro – Open-source macOS video editor built for AI — 专为AI构建的开源macOS视频编辑器。
Launch HN: Screenpipe (YC S26) – Record how you work and turn that into agents — 记录工作过程并转化为AI Agent。
Show HN: OneCLI – OSS credential gateway that keeps secrets out of AI agents — 开源凭证网关,保护AI Agent中的密钥安全。
The arguments against open source AI are bad — 针对开源AI的反对论点站不住脚的分析文章。
📝 编辑点评
今天的AI新闻呈现出几个明显趋势:
模型自主化竞赛加速:微软发布自研MAI系列并公布详细成本数据,在多个产品线中替换OpenAI模型,展示了从”合作伙伴”到”自主掌控”的战略转变。成本降低89%的数据极具冲击力。
全双工语音进入编程场景:OpenAI将GPT-Live的全双工能力带入Codex,标志着”语音编程”从演示走向实用。开发者在保持语境对话的同时指挥Agent执行异步任务,这可能是下一代人机交互范式的开端。
开源/轻量模型的工程化:Poolside的Laguna S 2.1和Echo项目共同展示了一个方向——不必追求万亿参数,通过MoE稀疏架构和模型路由策略,以更低的成本获得接近前沿的性能。”Token经济学”正在成为AI工程的核心考量。
Agent平台化:OpenAI Presence和Inflection Pi Journeys分别从企业和消费两端展示了Agent从实验到产品化的进程。安全控制、评估、升级机制成为Agent平台的标准配置。
发布日期:2026年7月24日 | 数据截至北京时间08:30