Qwen3.8 27B 用英文单词做加法:本地模型基准测试
一项基准测试检验本地模型 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达正整数加法结果。在 5,070 个禁用推理的用例中,其数字准确率为 23.57%,操作数从 1-3 位增至 10-13 位时准确率由 97.04% 降至 6.44%,格式合规率达 96.17%。启用中等推理后,169 次尝试中答对 167 次。
一项基准测试检验本地模型 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达正整数加法结果。在 5,070 个禁用推理的用例中,其数字准确率为 23.57%,操作数从 1-3 位增至 10-13 位时准确率由 97.04% 降至 6.44%,格式合规率达 96.17%。启用中等推理后,169 次尝试中答对 167 次。
9月23—24日,数字生态指数2026发布会暨成都科学城人工智能产业生态大会在成都举行,由北京大学大数据分析与应用技术国家工程实验室等联合主办。张平文发布《数字生态指数2026》报告,提出人工智能生态以“数、模、算、电”为核心底座,国际指数覆盖159个国家,城市数字生态第一梯队由6个扩容至12个。同期举办2026国产科学计算软件大会,发布北太天元2026版本。
NVIDIA 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等合作伙伴推出 64GB 统一内存版 DGX Spark,起售价 $4,999。
Latent Space 播客专访 MIT 研究者 Alex Zhang,探讨其递归语言模型(RLMs)、GPU 内核编写及大规模多智能体集群研究。
9月28日,“数智时代大中小学实景场域思政育人体系构建与实践创新研究”课题开题会在北京举行,由北京凤凰国际教育科技发展有限公司与中国矿业大学(北京)曾祥明团队共同开展。课题依托13年礼德教育实践及百万条学生成长数据,打造“版权课程+礼德垂直AI大模型智能体双驱动”模式,构建沉浸式实景德育场景,形成可评估、可持续迭代的德育闭环。
荷兰AI语言学习公司Eevi完成Pre种子轮融资,由欧洲创业加速器Rockstart领投,融资金额未披露。Eevi面向C端国际职场人士,将Gemini作为语音模型,支持约14种语言,采用付费订阅机制,6个月课程49欧元,单月18欧元。公司计划用这笔资金招聘核心成员、扩大规模。
Abre 在其数据智能平台中推出分析智能体“Vera”,支持用自然语言提问并即时获得角色感知的答案,无需数据专业知识。Vera 统一了 1,000 多个 K-12 数据源,提供实时 Liveboards、AI 摘要、KPI 阈值提醒等功能,并内置基于角色的访问控制,确保学生数据加密且不用于训练公共 AI 模型。Vera 提供 Basic、Enhanced 和 Premium 三个套餐层级。
微软研究院研究显示,将物理 AI 推理从机器人板载 GPU 卸载至边缘或云端 GPU,可显著提升任务成功率、支持更大模型并延长电池寿命。在移动操作测试中,板载 GPU 使导航障碍检测延迟降低 30%、VLA 模型准确率下降 50%,而 Jetson Thor 等 GPU 耗电最高达 160%。
斑马儿童科教集团在2026服贸会展示覆盖2至12岁儿童的AI伴学体系,将AI嵌入英语、思维、阅读等具体学习任务,而非单点问答工具。其自主研发的儿童科教大模型依托万亿级Token教育文本语料训练,已通过国家网信办生成式人工智能服务备案,并建立覆盖数据层、训练层和应用层的全链路安全体系。斑马强调“每天15分钟”短时高频学习,通过能力G值和成长报告持续追踪儿童成长轨迹。
微软研究院推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离与打结五类任务,并区分静态推理与交互规划两个认知层级。测试显示,当前闭源与开源模型在静态识别上明显强于交互规划,规划阶段常丢失结构关系或提出违反物理约束的动作,整体表现远低于人类水平。该基准旨在为机器人与交互环境中的 AI 系统提供诊断工具。
伯克利 AI 研究(Berkeley AI Research)提出 ABBEL 框架,将交互历史压缩为自然语言信念状态并对其内容进行监督评分,以解决长程任务中上下文无限增长与递归摘要性能下降的问题。
推理成本正以每年9倍至900倍的速度下降,GPT-4级能力从2023年初每百万token约30美元降至1美元以下,部分供应商已压至0.10美元以下。UC Berkeley学者Aditya G. Parameswaran团队提出,数据系统需面向智能体重构:为智能体优化查询复用与近似结果,支撑数千智能体的状态管理与协调,并探索由智能体合成可信数据系统。
随机对照试验结果显示,Gemini 的 Guided Learning 功能有望提升学习参与度并加速学习进程。该研究在塞拉利昂开展,并计划将成果推广至更广地区。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,通过稀疏性和低阶性将交互发现转化为可解的稀疏恢复问题,实现大规模识别 LLM 中的关键交互。ProxySPEX 利用层级结构,以约 10 倍更少的消融次数达到与 SPEX 相当的性能。在情感分析任务中,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME 和 Banzhaf 等边际方法。
该文提出一种基于分治范式的强化学习算法,替代传统时序差分(TD)学习,可将贝尔曼递归次数从线性降至对数级,避免误差累积,适用于长时程任务。研究在目标条件强化学习中首次实现该方法的规模化应用,无需调节n步TD的超参数,且不引入高方差或次优性。
加州大学伯克利分校研究团队首次为 word2vec 提供了定量预测理论,证明在现实训练条件下其学习问题可简化为无权重最小二乘矩阵分解,最终表示由 PCA 给出。训练中嵌入向量按离散步骤逐次学习正交概念,每个概念对应可解释的主题特征,理论预测与数值实验高度吻合。