面向真实世界物理 AI 机器人的推理卸载
微软研究院研究显示,将物理 AI 推理从机器人板载 GPU 卸载至边缘或云端 GPU,可显著提升任务成功率、支持更大模型并延长电池寿命。在移动操作测试中,板载 GPU 使导航障碍检测延迟降低 30%、VLA 模型准确率下降 50%,而 Jetson Thor 等 GPU 耗电最高达 160%。
微软研究院研究显示,将物理 AI 推理从机器人板载 GPU 卸载至边缘或云端 GPU,可显著提升任务成功率、支持更大模型并延长电池寿命。在移动操作测试中,板载 GPU 使导航障碍检测延迟降低 30%、VLA 模型准确率下降 50%,而 Jetson Thor 等 GPU 耗电最高达 160%。
OpenAI 发布 MentalHealthBench,一个由专家参与设计的评测基准,用于评估 AI 在真实心理健康对话中的有用性与安全性。该基准覆盖多种现实场景,旨在推动 AI 在心理健康领域的负责任应用。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中,于 Qwen3-VL 基准上吞吐量最高比 GB300 NVL72 提升 3.7 倍,在 DeepSeek-R1 上提升 2.5 倍。GB300 NVL72 在 288 GPU 扩展测试中实现 99% 扩展效率;软件优化较 v6.0 带来最高 1.6 倍性能提升。
OpenAI 最新经济研究揭示,工人正将 AI 用于传统岗位职责之外的新场景,部分新活动逐渐成为日常工作的固定环节。研究基于实际使用数据,展示了 AI 如何拓展工作边界并催生新的任务模式。
微软研究院推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离与打结五类任务,并区分静态推理与交互规划两个认知层级。测试显示,当前闭源与开源模型在静态识别上明显强于交互规划,规划阶段常丢失结构关系或提出违反物理约束的动作,整体表现远低于人类水平。该基准旨在为机器人与交互环境中的 AI 系统提供诊断工具。
微软研究院发布开源框架 Orchard,用于可扩展且低成本的智能体 AI 研究,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务。
推荐理由:原文给出了完整的技术方案、训练数据和基准成绩,读者可以据此评估开源智能体框架的复现成本与能力上限。
伯克利 AI 研究(Berkeley AI Research)提出 ABBEL 框架,将交互历史压缩为自然语言信念状态并对其内容进行监督评分,以解决长程任务中上下文无限增长与递归摘要性能下降的问题。
推理成本正以每年9倍至900倍的速度下降,GPT-4级能力从2023年初每百万token约30美元降至1美元以下,部分供应商已压至0.10美元以下。UC Berkeley学者Aditya G. Parameswaran团队提出,数据系统需面向智能体重构:为智能体优化查询复用与近似结果,支撑数千智能体的状态管理与协调,并探索由智能体合成可信数据系统。
随机对照试验结果显示,Gemini 的 Guided Learning 功能有望提升学习参与度并加速学习进程。该研究在塞拉利昂开展,并计划将成果推广至更广地区。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,通过稀疏性和低阶性将交互发现转化为可解的稀疏恢复问题,实现大规模识别 LLM 中的关键交互。ProxySPEX 利用层级结构,以约 10 倍更少的消融次数达到与 SPEX 相当的性能。在情感分析任务中,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME 和 Banzhaf 等边际方法。
该文提出一种基于分治范式的强化学习算法,替代传统时序差分(TD)学习,可将贝尔曼递归次数从线性降至对数级,避免误差累积,适用于长时程任务。研究在目标条件强化学习中首次实现该方法的规模化应用,无需调节n步TD的超参数,且不引入高方差或次优性。
加州大学伯克利分校研究团队首次为 word2vec 提供了定量预测理论,证明在现实训练条件下其学习问题可简化为无权重最小二乘矩阵分解,最终表示由 PCA 给出。训练中嵌入向量按离散步骤逐次学习正交概念,每个概念对应可解释的主题特征,理论预测与数值实验高度吻合。