Qwen3.8 27B 用英文单词做加法:本地模型基准测试
一项基准测试检验本地模型 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达正整数加法结果。在 5,070 个禁用推理的用例中,其数字准确率为 23.57%,操作数从 1-3 位增至 10-13 位时准确率由 97.04% 降至 6.44%,格式合规率达 96.17%。启用中等推理后,169 次尝试中答对 167 次。
一项基准测试检验本地模型 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达正整数加法结果。在 5,070 个禁用推理的用例中,其数字准确率为 23.57%,操作数从 1-3 位增至 10-13 位时准确率由 97.04% 降至 6.44%,格式合规率达 96.17%。启用中等推理后,169 次尝试中答对 167 次。
9月23—24日,数字生态指数2026发布会暨成都科学城人工智能产业生态大会在成都举行,由北京大学大数据分析与应用技术国家工程实验室等联合主办。张平文发布《数字生态指数2026》报告,提出人工智能生态以“数、模、算、电”为核心底座,国际指数覆盖159个国家,城市数字生态第一梯队由6个扩容至12个。同期举办2026国产科学计算软件大会,发布北太天元2026版本。
Latent Space 播客专访 MIT 研究者 Alex Zhang,探讨其递归语言模型(RLMs)、GPU 内核编写及大规模多智能体集群研究。
微软研究院研究显示,将物理 AI 推理从机器人板载 GPU 卸载至边缘或云端 GPU,可显著提升任务成功率、支持更大模型并延长电池寿命。在移动操作测试中,板载 GPU 使导航障碍检测延迟降低 30%、VLA 模型准确率下降 50%,而 Jetson Thor 等 GPU 耗电最高达 160%。
微软研究院推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离与打结五类任务,并区分静态推理与交互规划两个认知层级。测试显示,当前闭源与开源模型在静态识别上明显强于交互规划,规划阶段常丢失结构关系或提出违反物理约束的动作,整体表现远低于人类水平。该基准旨在为机器人与交互环境中的 AI 系统提供诊断工具。
伯克利 AI 研究(Berkeley AI Research)提出 ABBEL 框架,将交互历史压缩为自然语言信念状态并对其内容进行监督评分,以解决长程任务中上下文无限增长与递归摘要性能下降的问题。
推理成本正以每年9倍至900倍的速度下降,GPT-4级能力从2023年初每百万token约30美元降至1美元以下,部分供应商已压至0.10美元以下。UC Berkeley学者Aditya G. Parameswaran团队提出,数据系统需面向智能体重构:为智能体优化查询复用与近似结果,支撑数千智能体的状态管理与协调,并探索由智能体合成可信数据系统。
随机对照试验结果显示,Gemini 的 Guided Learning 功能有望提升学习参与度并加速学习进程。该研究在塞拉利昂开展,并计划将成果推广至更广地区。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,通过稀疏性和低阶性将交互发现转化为可解的稀疏恢复问题,实现大规模识别 LLM 中的关键交互。ProxySPEX 利用层级结构,以约 10 倍更少的消融次数达到与 SPEX 相当的性能。在情感分析任务中,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME 和 Banzhaf 等边际方法。
该文提出一种基于分治范式的强化学习算法,替代传统时序差分(TD)学习,可将贝尔曼递归次数从线性降至对数级,避免误差累积,适用于长时程任务。研究在目标条件强化学习中首次实现该方法的规模化应用,无需调节n步TD的超参数,且不引入高方差或次优性。
加州大学伯克利分校研究团队首次为 word2vec 提供了定量预测理论,证明在现实训练条件下其学习问题可简化为无权重最小二乘矩阵分解,最终表示由 PCA 给出。训练中嵌入向量按离散步骤逐次学习正交概念,每个概念对应可解释的主题特征,理论预测与数值实验高度吻合。