跳到正文

#大模型

今日 1 条
今天10月6日周二
  1. Simon Willison31

    Qwen3.8 27B 用英文单词做加法:本地模型基准测试

    一项基准测试检验本地模型 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达正整数加法结果。在 5,070 个禁用推理的用例中,其数字准确率为 23.57%,操作数从 1-3 位增至 10-13 位时准确率由 97.04% 降至 6.44%,格式合规率达 96.17%。启用中等推理后,169 次尝试中答对 167 次。

10月5日周一
  1. 北京大学新闻网42

    数字生态指数2026发布会暨成都科学城人工智能产业生态大会举行

    9月23—24日,数字生态指数2026发布会暨成都科学城人工智能产业生态大会在成都举行,由北京大学大数据分析与应用技术国家工程实验室等联合主办。张平文发布《数字生态指数2026》报告,提出人工智能生态以“数、模、算、电”为核心底座,国际指数覆盖159个国家,城市数字生态第一梯队由6个扩容至12个。同期举办2026国产科学计算软件大会,发布北太天元2026版本。

10月2日周五
9月30日周三
  1. 知新编辑部 · 权威媒体18

    “数智时代大中小学实景场域思政育人体系构建与实践创新研究”课题开题会在京举行

    9月28日,“数智时代大中小学实景场域思政育人体系构建与实践创新研究”课题开题会在北京举行,由北京凤凰国际教育科技发展有限公司与中国矿业大学(北京)曾祥明团队共同开展。课题依托13年礼德教育实践及百万条学生成长数据,打造“版权课程+礼德垂直AI大模型智能体双驱动”模式,构建沉浸式实景德育场景,形成可评估、可持续迭代的德育闭环。

9月24日周四
  1. eSchool News48

    Abre 推出“Vera”分析智能体,旨在取代静态 K-12 仪表盘

    Abre 在其数据智能平台中推出分析智能体“Vera”,支持用自然语言提问并即时获得角色感知的答案,无需数据专业知识。Vera 统一了 1,000 多个 K-12 数据源,提供实时 Liveboards、AI 摘要、KPI 阈值提醒等功能,并内置基于角色的访问控制,确保学生数据加密且不用于训练公共 AI 模型。Vera 提供 Basic、Enhanced 和 Premium 三个套餐层级。

9月9日周三
  1. 芥末堆38

    斑马儿童科教集团亮相2026服贸会 展示「AI赋能儿童教育」的中国样本

    斑马儿童科教集团在2026服贸会展示覆盖2至12岁儿童的AI伴学体系,将AI嵌入英语、思维、阅读等具体学习任务,而非单点问答工具。其自主研发的儿童科教大模型依托万亿级Token教育文本语料训练,已通过国家网信办生成式人工智能服务备案,并建立覆盖数据层、训练层和应用层的全链路安全体系。斑马强调“每天15分钟”短时高频学习,通过能力G值和成长报告持续追踪儿童成长轨迹。

8月13日周四
  1. Microsoft Research38

    MindTopo 基准揭示多模态大模型的空间推理短板

    微软研究院推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离与打结五类任务,并区分静态推理与交互规划两个认知层级。测试显示,当前闭源与开源模型在静态识别上明显强于交互规划,规划阶段常丢失结构关系或提出违反物理约束的动作,整体表现远低于人类水平。该基准旨在为机器人与交互环境中的 AI 系统提供诊断工具。

7月26日周日
7月7日周二
  1. Berkeley AI Research43

    智能近乎免费之后:面向智能体的数据系统(For、Of、By Agents)

    推理成本正以每年9倍至900倍的速度下降,GPT-4级能力从2023年初每百万token约30美元降至1美元以下,部分供应商已压至0.10美元以下。UC Berkeley学者Aditya G. Parameswaran团队提出,数据系统需面向智能体重构:为智能体优化查询复用与近似结果,支撑数千智能体的状态管理与协调,并探索由智能体合成可信数据系统。

6月8日周一
3月13日周五
  1. Berkeley AI Research38

    SPEX 与 ProxySPEX:大规模识别 LLM 关键交互

    Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,通过稀疏性和低阶性将交互发现转化为可解的稀疏恢复问题,实现大规模识别 LLM 中的关键交互。ProxySPEX 利用层级结构,以约 10 倍更少的消融次数达到与 SPEX 相当的性能。在情感分析任务中,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME 和 Banzhaf 等边际方法。

11月1日周六
9月1日周一