跳到正文

全部动态

今日 1 条
今天10月6日周二
  1. Simon Willison31

    Qwen3.8 27B 用英文单词做加法:本地模型基准测试

    一项基准测试检验本地模型 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达正整数加法结果。在 5,070 个禁用推理的用例中,其数字准确率为 23.57%,操作数从 1-3 位增至 10-13 位时准确率由 97.04% 降至 6.44%,格式合规率达 96.17%。启用中等推理后,169 次尝试中答对 167 次。

10月5日周一
  1. The Decoder70

    MIT 报告:AI 正在侵蚀答疑时间、学习小组与师生信任

    MIT 2026 年 6 月发布报告指出,AI 正在削弱大学体验的核心环节:学生减少参加答疑时间,线上讨论参与度下降,宿舍和图书馆的学习小组变少,教师越来越难判断学生的真实学习情况。

    推荐理由:报告用 MIT 内部数据与多校研究对照,呈现 AI 对师生信任和真实学习的冲击,适合作为高校制定 AI 政策的参考。

  2. 北京大学新闻网42

    数字生态指数2026发布会暨成都科学城人工智能产业生态大会举行

    9月23—24日,数字生态指数2026发布会暨成都科学城人工智能产业生态大会在成都举行,由北京大学大数据分析与应用技术国家工程实验室等联合主办。张平文发布《数字生态指数2026》报告,提出人工智能生态以“数、模、算、电”为核心底座,国际指数覆盖159个国家,城市数字生态第一梯队由6个扩容至12个。同期举办2026国产科学计算软件大会,发布北太天元2026版本。

10月3日周六
  1. The Decoder64

    哈佛物理学家开源 BootLoops,用 Claude 完成精确科学计算并产出 36 篇论文

    哈佛大学物理学家 Matthew Schwartz 在 Anthropic 客座期间开发了开源工具 BootLoops,用于驱动 Claude 进行精确科学计算。三个月内团队在 18 个领域产出 36 篇论文,包括解决生态学中 20 年未解的方程、分析 57 亿对突变等。Schwartz 同时指出模型会过早宣布完成、计算正确但结论错误等局限,强调人类专家仍不可或缺。

    推荐理由:原文给出了开源工具 BootLoops 的实际产出与局限,读者可据此判断 AI 在科研中的真实边界。

10月2日周五
10月1日周四
  1. EdSurge71

    EdReports 研究:教育科技公司急于集成 AI,却缺乏有效性证据

    EdReports 发布简报指出,课程与教育科技供应商正迅速将 AI 集成到教学材料中,但几乎没有证据表明这些 AI 附加功能能改善学生学习。在研究的 10 家供应商中,仅 1 家提供了第三方证据证明其 AI 功能提升了教育成果。

    推荐理由:EdReports 对 10 家 K-12 教育科技供应商的调研显示,多数 AI 功能缺乏第三方证据,提醒采购方关注产品实效。

9月30日周三
9月26日周六
  1. Ars Technica · AI47

    斯坦福研究称AI冲击应届生就业,慕尼黑CESifo新论文却得出相反结论

    慕尼黑CESifo经济研究所新论文《AI对近期大学毕业生就业的早期影响》直接反驳斯坦福大学此前研究,称“没有证据表明AI对近期大学毕业生就业造成显著、广泛的替代或减少”。研究者Robert Fairlie和Jane Wu聚焦应届生,因劳动力需求变化或先体现在招聘减少上。论文同时指出,人口普查调查显示越来越多企业正用AI替代大量员工任务。

9月25日周五
  1. eSchool News70

    全国调查:教师如何看待课堂技术现实

    沃尔顿家族基金会与盖洛普联合发布的报告显示,59%的教师认为数字工具有助于学生学习,但仅10%强烈认同;52%认为设备弊大于利。教师希望在选择技术时有更大发言权,仅29%曾被征询意见。报告指出,监督而非屏幕时间限制是改善课堂技术使用的关键杠杆。

    推荐理由:报告呈现教师对课堂技术的真实态度,可帮助理解设备使用争议背后的关键因素。

9月24日周四
  1. 芥末堆21

    从“知识占有”到“能力提升”,2027版高考蓝皮书带着一线老师的答案来了

    9月19日,2027版高考蓝皮书学术成果在北京大学发布,全系列共48本、覆盖9大学科,紧扣人工智能时代高考改革方向。丛书提出“点—链—网”命题模型,新增SOLO分类理论与AI辅助命题内容,并系统阐释复习理念与关键能力培养,帮助一线教师从“会做题”转向“会命题”。

9月23日周三
  1. Education Next78

    学生使用AI的代价:基于中国中学大样本研究的分析

    作者引用一项覆盖约2.7万名中国中学生的研究指出,2023至2025年间约80%学生开始使用生成式AI,其中约50%在五个月内完全外包作业,导致闭卷考试成绩平均下降20%,中考和高考成绩分别下降24%和18%,且未发现任何学习收益。作者认为AI是认知自动化工具,呼吁教育者关注其实际危害而非想象潜力。

    推荐理由:作者基于一项覆盖近两万七千名中国中学生的大样本研究,给出了AI导致学习下降的具体数据,并回应了常见反驳观点。

9月21日周一
  1. 芥末堆46

    《2026智能教育发展蓝皮书——人工智能助力打造未来课堂》正式发布

    讯飞教育技术研究院/认知智能全国重点实验室智能教育研究中心与中国教育技术协会智能教育专业委员会联合发布《2026智能教育发展蓝皮书——人工智能助力打造未来课堂》,9月19日在第八届智能教育论坛上正式亮相。蓝皮书共8章,基于366个实践案例,系统梳理元宇宙学习空间、智能教室、数字教材、教学智能体等新型课堂要素,并研判风险挑战,为未来课堂建设提供参考。

9月16日周三
  1. EdSurge40

    被遗忘的中间群体:为什么三年级后孩子阅读仍吃力

    NWEA 研究显示,疫情后阅读成绩整体回升,但最低水平的中学生读者每年仍在退步。Coursemojo 联合创始人 Dacia Toll 指出,四年级流利阅读的孩子到六年级却答不出基础理解题,源于文本难度提升与背景知识专业化双重压力。她强调,AI 工具应引导 struggling reader 回到文本自主思考,而非直接给答案。

9月15日周二
  1. Education Next58

    田纳西州更严格教师任期规则带来持续绩效收益

    Eric S. Taylor基于田纳西州教师数据发现,2011—12学年实施的多指标评价与更严格任期规则,使新教师早期增值绩效提升4.7%的标准差。研究显示,单独的评价改革带来2.4%的标准差提升,任期激励额外带来2.3%的提升;新教师前六年的累计增值绩效增长达到7.9%,且教师获得任期后绩效没有明显下降。

    推荐理由:这项田纳西州教师数据研究区分了评价改革与任期激励,呈现早期绩效提升及任期后的持续效果,为理解教师激励政策提供了可比较证据。

8月18日周二
  1. EdSurge56

    NBER 研究:雇主对社区学院幼儿教育学士学位与传统学位看法相当

    美国国家经济研究局(NBER)新工作论文发现,雇主对社区学院幼儿教育学士学位求职者与传统四年制大学学士学位持有者看法大致相同,没有证据表明存在系统性歧视。研究基于虚构求职申请的回复比较;自 2024 年以来,提供学士学位的社区学院从 187 所增至 214 所,项目从 678 个增至 763 个。

8月13日周四
  1. Microsoft Research38

    MindTopo 基准揭示多模态大模型的空间推理短板

    微软研究院推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离与打结五类任务,并区分静态推理与交互规划两个认知层级。测试显示,当前闭源与开源模型在静态识别上明显强于交互规划,规划阶段常丢失结构关系或提出违反物理约束的动作,整体表现远低于人类水平。该基准旨在为机器人与交互环境中的 AI 系统提供诊断工具。

8月4日周二
7月26日周日
7月7日周二
  1. Berkeley AI Research43

    智能近乎免费之后:面向智能体的数据系统(For、Of、By Agents)

    推理成本正以每年9倍至900倍的速度下降,GPT-4级能力从2023年初每百万token约30美元降至1美元以下,部分供应商已压至0.10美元以下。UC Berkeley学者Aditya G. Parameswaran团队提出,数据系统需面向智能体重构:为智能体优化查询复用与近似结果,支撑数千智能体的状态管理与协调,并探索由智能体合成可信数据系统。

6月8日周一
3月13日周五
  1. Berkeley AI Research38

    SPEX 与 ProxySPEX:大规模识别 LLM 关键交互

    Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,通过稀疏性和低阶性将交互发现转化为可解的稀疏恢复问题,实现大规模识别 LLM 中的关键交互。ProxySPEX 利用层级结构,以约 10 倍更少的消融次数达到与 SPEX 相当的性能。在情感分析任务中,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME 和 Banzhaf 等边际方法。

11月1日周六
9月1日周一