每日科技速递 - 2026-07-10

每日科技速递 - 2026-07-10

今天的主线是"从对话到协作":多模态交互正在把 Agent 从被动的 Prompt 响应者推向主动的任务参与者。原力灵机 DM0.5 用 15 万小时数据把机器人 Zero-Shot 能力拔高了 31%,LingBot-World 2.0 用双 Agent 架构让虚拟世界"活"了起来,而 SGLang 团队在 DeepSeek V4 百万上下文推理上的全栈优化则展示了 AI Infra 正在从"能跑"走向"高效跑"。零一万物在后李开复时代的自我定位也给出了一个行业样本。

🧠 LLM / Large Models

  • 🔥2 | Zero-Shot提升31%!原力灵机DM0.5登场,15万小时数据喂出 — 原力灵机发布 DM0.5 机器人基础模型,基于 15 万小时真实机器人操作数据训练,在未见过的任务上 Zero-Shot 成功率提升 31%。该模型主打具身智能领域的"通用基座"路线,意味着机器人不再需要为每一种新任务重新采集数据,而是通过大规模预训练获得跨任务的泛化能力。15 万小时的数据规模也刷新了机器人预训练数据的纪录。
    Zero-Shot提升31%!原力灵机DM0.5登场,15万小时数据喂出

  • 🔥2 | 「没了李开复,零一万物还有什么?」一个敢问一个敢答 — 量子位对零一万物(01.AI)在李开复卸任后的战略走向进行了深度访谈。文章直面"创始人光环褪去后公司还剩什么"的尖锐问题,探讨了零一万物在开源模型、企业服务和海外市场的布局。在当前大模型创业公司普遍面临商业化压力的背景下,零一万物的回答代表了一类"技术派"AI 公司的新叙事:从个人 IP 驱动转向产品和工程驱动。
    「没了李开复,零一万物还有什么?」一个敢问一个敢答

  • 🔥2 | 百万上下文下的 DeepSeek V4:SGLang 推理优化实战 — SGLang 团队将在 AICon 深圳分享对 DeepSeek V4 的推理优化实践。DeepSeek V4 采用了 SWA + CSA(4:1压缩+TopK筛选)+ HCA(128:1压缩)的混合注意力架构,比 V3 的单一 MLA 结构复杂得多。团队提出 ShadowRadix 统一管理三套 KV Cache,并通过 FlashCompressor 融合算子将 HBM 读写从 5 次降至 2 次,Lightning TopK 将百万上下文下的索引操作从 100μs 压缩到 15μs。在 GB300 NVL72 上实现了百万级上下文的 Day-0 支持。
    百万上下文下的 DeepSeek V4:SGLang 推理优化实战|AICon深圳

🤖 AI Agent

  • 🔥2 | Agent 进化论:从对话到协作 — InfoQ 深度报道了多模态交互如何驱动 Agent 从"工具"进化为"协作伙伴"。数据显示豆包 App 音频用量环比增长 200%,视频增长 350%,音视频模型日均 Token 消耗已达千亿级别。文章核心观点是:多模态交互不只是"不用打字",而是让 Agent 进入任务的时间点大幅前移——从结果生成环节提前到需求讨论、方案澄清和执行监督。TRAE Work 的数据佐证了这一趋势:用户平均每通语音对话与 Agent 交互 17 轮,70% 用于方案讨论,仅 30% 用于代码生成。Agent 的竞争力正在从"能做什么"转向"能多好地配合你"。
    Agent 进化论:从对话到协作

  • 🔥2 | LingBot-World 2.0:双 Agent 架构让虚拟世界"活"起来 — 蚂蚁灵波在不到半年的时间内将 LingBot-World 迭代至 2.0 版本。核心创新是双 Agent 架构:Director Agent(VLM)负责场景推进和语义规则,Pilot Agent(DiT)负责物理动态模拟和视觉渲染——类似大脑/小脑的共同模拟框架。模型提供 14B 和 1.3B 蒸馏版本,后者可在消费级显卡上稳定输出 720p/60fps。用户可以实时交互并在生成后继续用提示词修改世界逻辑、环境和角色。与 Genie 3 等竞品对比中,LingBot-World 2.0 在生成时长、动作自由度等方面全面领先。
    LingBot-World 2.0 实测:无限时长、随机变化的世界,终于来了?

  • 🔥2 | AI Infra 拼什么? — InfoQ 视频专题探讨了 Agent 时代下 AI 基础设施的核心竞争维度。当模型能力逐渐成为行业标配,真正的差异化正在从模型本身转向推理效率、多架构算力调度和工程化落地能力。DeepSeek V4 的百万上下文推理优化、腾讯云 Cube Sandbox 的 Arm 架构支持都是这一趋势的注脚。
    AI Infra 拼什么?

🔬 Frontier Tech

  • 🔥2 | iOS 27 Beta 2 & 3 值得关注的新特性 — 少数派详细梳理了 iOS 27 近两个测试版的更新。Beta 2 带来了全新 Siri 写作工具"Write with Siri",可在任意应用键盘中直接调用,不再需要选中文字;RCS 跨平台消息支持引用回复和表情回应;家庭 App 首次接入 Apple Intelligence。Beta 3 更关键:Siri AI 开始支持从第三方 App 读取信息(目前可见的是电动车电池数据),标志着新 Siri 突破了 Apple 自家 App 的数据边界。Apple Intelligence for Home 需要 2TB 起 iCloud+ 订阅,这也暗示了端侧+云端混合推理的成本门槛。
    iOS 27 Beta 2 & 3 值得关注的新特性

  • 🔥2 | I've decoded a #pragma detect_mismatch error and fixed the mismatch, but I still get the error — Raymond Chen 延续了他标志性的"一个 bug 讲透一个机制"风格。这次的案例是:开发者修复了 #pragma detect_mismatch 错误后重新编译,错误依然存在。根因是冲突的 obj 文件在一个不属于当前项目的静态库中,只重建项目而不重建依赖库无效。文章由此展开到 ODR(单一定义规则)错误的通用原则:任何头文件定义的变更都需要重新编译所有依赖它的编译单元。这种"看起来修好了但其实没修"的场景在大型 C++ 工程中极其常见。
    https://devblogs.microsoft.com/oldnewthing/20260709-00/?p=112512

📝 Blog Picks

  • I've decoded a #pragma detect_mismatch error — Raymond Chen | 这不是一个新 API 或黑科技,而是一个每个 C++ 工程师都踩过的坑的精确解剖。文章的价值在于把 #pragma detect_mismatch 这个冷门编译指令还原到 ODR 规则的通用框架下理解,而不只是给一个"clean rebuild"的速效答案。对于那些接手大型遗留代码库的工程师来说,理解 ODR 的传播链条比记住一个编译指令有用得多。
    https://devblogs.microsoft.com/oldnewthing/20260709-00/?p=112512

  • LingBot-World 2.0 实测 — 爱范儿 APPSO | 这篇深度测评不只是罗列参数,而是通过实际体验展示了世界模型从"生成一段视频"到"生成一个可交互的世界"的质变。双 Agent 架构的类比(导演 vs 演员)非常直观地解释了技术架构为什么这样设计。对于关注 AI 在游戏、仿真和数字孪生领域落地的读者,这是本周最有信息增量的一篇报道。
    https://www.ifanr.com/1671406

  • Agent 进化论:从对话到协作 — InfoQ | 这篇文章的价值在于数据驱动:豆包 App 350% 的视频用量增长、千亿级日均 Token 消耗、TRAE Work 70% 对话用于方案讨论而非代码生成——这些数字比任何趋势预测都更有说服力。它揭示了一个被低估的变化:Agent 的主战场正在从"执行"前移到"讨论",这意味着产品设计的重心也要从"输出质量"转向"沟通质量"。
    https://www.infoq.cn/article/6StbVmZr0cicGREVjwZu


📊 Data Sources: RSS 52 | Twitter 0 | Reddit 0 | Web 0 | GitHub 0 releases + 0 trending | Dedup: 17 articles 🤖 Generated by tech-news-digest v3.14.0 | https://github.com/draco-agent/tech-news-digest | Powered by OpenClaw