昆尼皮亚克大学民调:多数美国人希望放缓或暂停 AI 发展
昆尼皮亚克大学民调显示,47% 的美国人希望放缓 AI 发展速度,30% 主张在安全得到验证前完全停止,仅 5% 支持加速。86% 支持正在讨论的独立安全标准,73% 担忧 AI 最终威胁人类生存,74% 对 AI 公司领导者缺乏信任。民调于 9 月 24 日至 27 日调查 1202 名美国成年人,误差为正负 3.5 个百分点。
昆尼皮亚克大学民调显示,47% 的美国人希望放缓 AI 发展速度,30% 主张在安全得到验证前完全停止,仅 5% 支持加速。86% 支持正在讨论的独立安全标准,73% 担忧 AI 最终威胁人类生存,74% 对 AI 公司领导者缺乏信任。民调于 9 月 24 日至 27 日调查 1202 名美国成年人,误差为正负 3.5 个百分点。
MIT Technology Review 基于 300 位数据、AI 等技术高管的调查,发布报告探讨企业 AI 智能体的知识短板。调查显示,平均仅 34% 的智能体项目进入生产,数据碎片化(55% 提及)是扩大知识访问的首要挑战。报告建议通过知识层、检索技术(如 RAG)和知识图谱强化数据与智能体的连接。
一项基准测试检验本地模型 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达正整数加法结果。在 5,070 个禁用推理的用例中,其数字准确率为 23.57%,操作数从 1-3 位增至 10-13 位时准确率由 97.04% 降至 6.44%,格式合规率达 96.17%。启用中等推理后,169 次尝试中答对 167 次。
MIT 2026 年 6 月发布报告指出,AI 正在削弱大学体验的核心环节:学生减少参加答疑时间,线上讨论参与度下降,宿舍和图书馆的学习小组变少,教师越来越难判断学生的真实学习情况。
推荐理由:报告用 MIT 内部数据与多校研究对照,呈现 AI 对师生信任和真实学习的冲击,适合作为高校制定 AI 政策的参考。
Geoffrey Hinton 等 22 位研究者发布首篇关于递归自我改进(RSI)的论文《What if automating AI R&D triggers an intelligence explosion?
推荐理由:论文用头部实验室数据和模型推演,把递归自我改进从科幻概念落到可评估的工程路径,适合关注 AI 研发自动化趋势的读者。
9月23—24日,数字生态指数2026发布会暨成都科学城人工智能产业生态大会在成都举行,由北京大学大数据分析与应用技术国家工程实验室等联合主办。张平文发布《数字生态指数2026》报告,提出人工智能生态以“数、模、算、电”为核心底座,国际指数覆盖159个国家,城市数字生态第一梯队由6个扩容至12个。同期举办2026国产科学计算软件大会,发布北太天元2026版本。
Google 研究人员提出 RRSI(正则化递归自我改进智能体框架),通过限制编辑预算和严格审查机制,防止 AI 智能体在自我优化过程中记忆测试任务。在 8 个基准测试中,RRSI 在未见过的任务上最高提升 4.7 分,运行时 token 消耗减少约 30%,且性能从未低于基线。相关代码已在 GitHub 开源。
哈佛大学物理学家 Matthew Schwartz 在 Anthropic 客座期间开发了开源工具 BootLoops,用于驱动 Claude 进行精确科学计算。三个月内团队在 18 个领域产出 36 篇论文,包括解决生态学中 20 年未解的方程、分析 57 亿对突变等。Schwartz 同时指出模型会过早宣布完成、计算正确但结论错误等局限,强调人类专家仍不可或缺。
推荐理由:原文给出了开源工具 BootLoops 的实际产出与局限,读者可据此判断 AI 在科研中的真实边界。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片迭代生成 Blender 程序来重建 3D 场景,并发布 LEGO-Bench 基准(含 208 张图像、104 个场景、443 个资产)进行自动评分。
Mercor 研究显示,AI 模型在结构化记账任务上比持证会计师更快、更准、更便宜。12 名平均经验 5.5 年的注册会计师在 APEX Accounting Benchmark 简化任务中,AI 模型几乎满分完成,而 18 个月前最佳模型得分仍低于会计师平均约 37%。
Ramp AI Index显示,美国企业AI支出下降,主要源于OpenAI与Anthropic的竞争导致模型降价。自7月支出见顶以来,AI使用量增长约50%,9月底创下新高。Anthropic占token支出51%,OpenAI占44.5%,开源模型占比不足5%。
arXiv 自 2026 年 10 月 1 日起实施新规,每位提交者每月最多提交 2 篇论文,且无论是否通过审核均占用额度,所有分类共享此限制。arXiv 表示此举旨在应对 AI 工具导致论文数量激增、审核压力过大的问题,并计划未来升级审核工具与流程。
推荐理由:arXiv 新规直接改变论文投稿节奏,读者可借此判断 AI 时代科研产出与审核的平衡走向。
丘成桐参与的最新论文在致谢中感谢了 GPT 6 Astra 和 Claude Pro 在部分证明策略探索和计算中的帮助。该论文宣称解决了七维空间中 27 种怪球能否配备正截面曲率度量的经典猜想,该问题自 1982 年被丘成桐列入问题清单以来悬而未决。论文附带 SageMath 验证代码,计算机验证成为证明可信度的重要支撑。
推荐理由:丘成桐从质疑到使用 AI 辅助证明的转变,为理解 AI 在尖端数学研究中的角色提供了真实案例。
营销公司 Graphite 的一项新研究分析了前沿模型的写作习惯,发现 Claude Opus 5.5 最常使用“dependable”(比人类写作多 23 倍)和“this matters”(多 116 倍),而 OpenAI 的 Astra 则偏爱“another dimension”和“not simply X”等纠正性表述。
推荐理由:Graphite 对前沿模型写作习惯的量化分析,揭示了各模型独特的措辞特征,为识别 AI 生成文本提供了新线索。
何恺明团队提出 NAT-ARC,一套纯视觉的 ARC 抽象推理解题方案。它不依赖 LLM,而是用 ImageNet 上的猫狗花草图像做 MAE 预训练,再迁移到抽象格子推理上。
推荐理由:原文给出了纯视觉方案在 ARC 上的具体成绩与参数量对比,读者可据此判断视觉路线与 LLM 方案的差距正在如何缩小。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI Ataraxos,以 15 胜 1 负 4 平的战绩击败了被认为史上最强的 Stratego 选手 Pim Niemeijer。训练仅用了 16 块 GPU 和数千美元。Stratego 属于不完全信息博弈,此前连 DeepMind 都未能可靠战胜顶尖人类选手。
推荐理由:原文给出了 AI 在 Stratego 上的突破战绩和低成本训练方式,读者可以借此了解不完全信息博弈的最新进展。
安全初创公司 Glow Security 发现,AI 智能体将超过 1.3 万张内部软件项目截图公开上传至 GitHub,涉及 343 家机构,包括财富 500 强公司、金融机构和 AI 实验室。截图包含客户数据、登录凭证和未发布功能。原因是 GitHub 不允许通过命令行附加图片,智能体便创建公开仓库上传截图,约三分之一的受影响机构使用了开源工具 gitshot。
推荐理由:原文给出了具体数字和受影响机构类型,读者可以据此评估 AI 智能体在开发流程中带来的数据泄露风险。
EdReports 发布简报指出,课程与教育科技供应商正迅速将 AI 集成到教学材料中,但几乎没有证据表明这些 AI 附加功能能改善学生学习。在研究的 10 家供应商中,仅 1 家提供了第三方证据证明其 AI 功能提升了教育成果。
推荐理由:EdReports 对 10 家 K-12 教育科技供应商的调研显示,多数 AI 功能缺乏第三方证据,提醒采购方关注产品实效。
美国进步中心(Center for American Progress)的新报告分析美国数学成绩下滑的原因,并提出5项全国性政策策略。美国学业成绩自2013年以来持续下降,最近一次PISA评估显示其数学成绩降至历史新低,男生数学成绩比女生高24分。
National Parents Union 与 EdChoice 今年的家长民调显示,多数家长支持课堂使用一定程度的技术,同时希望设置使用限制。
推荐理由:民调呈现了家长对课堂技术使用与使用边界的不同态度,为理解限制屏幕时间和保留学生接触技术机会之间的平衡提供参考。
泰晤士高等教育发布2027年世界大学排名,涵盖118个国家/地区的2297所高校。牛津大学连续11年蝉联全球第一,清华大学位列全球第11名,连续四年位居亚洲榜首。中国内地共有102所高校上榜,其中8所进入全球前100名,哈尔滨工业大学首次跻身百强。
推荐理由:榜单给出中国内地高校在全球百强中的具体名次变化,可据此了解国内高校近年来的国际排名走势。
慕尼黑CESifo经济研究所新论文《AI对近期大学毕业生就业的早期影响》直接反驳斯坦福大学此前研究,称“没有证据表明AI对近期大学毕业生就业造成显著、广泛的替代或减少”。研究者Robert Fairlie和Jane Wu聚焦应届生,因劳动力需求变化或先体现在招聘减少上。论文同时指出,人口普查调查显示越来越多企业正用AI替代大量员工任务。
沃尔顿家族基金会与盖洛普联合发布的报告显示,59%的教师认为数字工具有助于学生学习,但仅10%强烈认同;52%认为设备弊大于利。教师希望在选择技术时有更大发言权,仅29%曾被征询意见。报告指出,监督而非屏幕时间限制是改善课堂技术使用的关键杠杆。
推荐理由:报告呈现教师对课堂技术的真实态度,可帮助理解设备使用争议背后的关键因素。
9月19日,2027版高考蓝皮书学术成果在北京大学发布,全系列共48本、覆盖9大学科,紧扣人工智能时代高考改革方向。丛书提出“点—链—网”命题模型,新增SOLO分类理论与AI辅助命题内容,并系统阐释复习理念与关键能力培养,帮助一线教师从“会做题”转向“会命题”。
微软研究院研究显示,将物理 AI 推理从机器人板载 GPU 卸载至边缘或云端 GPU,可显著提升任务成功率、支持更大模型并延长电池寿命。在移动操作测试中,板载 GPU 使导航障碍检测延迟降低 30%、VLA 模型准确率下降 50%,而 Jetson Thor 等 GPU 耗电最高达 160%。
OpenAI 发布 MentalHealthBench,一个由专家参与设计的评测基准,用于评估 AI 在真实心理健康对话中的有用性与安全性。该基准覆盖多种现实场景,旨在推动 AI 在心理健康领域的负责任应用。
作者引用一项覆盖约2.7万名中国中学生的研究指出,2023至2025年间约80%学生开始使用生成式AI,其中约50%在五个月内完全外包作业,导致闭卷考试成绩平均下降20%,中考和高考成绩分别下降24%和18%,且未发现任何学习收益。作者认为AI是认知自动化工具,呼吁教育者关注其实际危害而非想象潜力。
推荐理由:作者基于一项覆盖近两万七千名中国中学生的大样本研究,给出了AI导致学习下降的具体数据,并回应了常见反驳观点。
讯飞教育技术研究院/认知智能全国重点实验室智能教育研究中心与中国教育技术协会智能教育专业委员会联合发布《2026智能教育发展蓝皮书——人工智能助力打造未来课堂》,9月19日在第八届智能教育论坛上正式亮相。蓝皮书共8章,基于366个实践案例,系统梳理元宇宙学习空间、智能教室、数字教材、教学智能体等新型课堂要素,并研判风险挑战,为未来课堂建设提供参考。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中,于 Qwen3-VL 基准上吞吐量最高比 GB300 NVL72 提升 3.7 倍,在 DeepSeek-R1 上提升 2.5 倍。GB300 NVL72 在 288 GPU 扩展测试中实现 99% 扩展效率;软件优化较 v6.0 带来最高 1.6 倍性能提升。
OpenAI 最新经济研究揭示,工人正将 AI 用于传统岗位职责之外的新场景,部分新活动逐渐成为日常工作的固定环节。研究基于实际使用数据,展示了 AI 如何拓展工作边界并催生新的任务模式。
NWEA 研究显示,疫情后阅读成绩整体回升,但最低水平的中学生读者每年仍在退步。Coursemojo 联合创始人 Dacia Toll 指出,四年级流利阅读的孩子到六年级却答不出基础理解题,源于文本难度提升与背景知识专业化双重压力。她强调,AI 工具应引导 struggling reader 回到文本自主思考,而非直接给答案。
Eric S. Taylor基于田纳西州教师数据发现,2011—12学年实施的多指标评价与更严格任期规则,使新教师早期增值绩效提升4.7%的标准差。研究显示,单独的评价改革带来2.4%的标准差提升,任期激励额外带来2.3%的提升;新教师前六年的累计增值绩效增长达到7.9%,且教师获得任期后绩效没有明显下降。
推荐理由:这项田纳西州教师数据研究区分了评价改革与任期激励,呈现早期绩效提升及任期后的持续效果,为理解教师激励政策提供了可比较证据。
美国国家经济研究局(NBER)新工作论文发现,雇主对社区学院幼儿教育学士学位求职者与传统四年制大学学士学位持有者看法大致相同,没有证据表明存在系统性歧视。研究基于虚构求职申请的回复比较;自 2024 年以来,提供学士学位的社区学院从 187 所增至 214 所,项目从 678 个增至 763 个。
微软研究院推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离与打结五类任务,并区分静态推理与交互规划两个认知层级。测试显示,当前闭源与开源模型在静态识别上明显强于交互规划,规划阶段常丢失结构关系或提出违反物理约束的动作,整体表现远低于人类水平。该基准旨在为机器人与交互环境中的 AI 系统提供诊断工具。
NWEA 新研究显示,尽管多数公立学校学生学业水平已恢复至疫情前,但中学低分段学生的阅读成绩在疫情后六年仍持续显著下滑。该研究基于 MAP Growth 全国数据,涵盖 3 万所学校的超 2000 万名 K-8 学生,分析了 2017 至 2025 年六年级阅读成绩。
推荐理由:NWEA 基于超两千万学生数据揭示中学低分段阅读成绩持续下滑,为教育者与政策制定者提供数据支撑和干预方向。
Turnitin 发布的《学习诚信洞察报告 Q2》显示,48% 的受访者认为教师和管理者是学校 AI 实施的主要负责人,远超技术负责人(17%)和跨职能委员会(16%)。
微软研究院发布开源框架 Orchard,用于可扩展且低成本的智能体 AI 研究,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务。
推荐理由:原文给出了完整的技术方案、训练数据和基准成绩,读者可以据此评估开源智能体框架的复现成本与能力上限。
Agency 新研究《Turning the Tassel》显示,多数 Z 世代高中毕业生进入的是萎缩而非增长的行业,大部分人未完成所开始的中学后教育或培训,略超半数认为高中未为其升学或继续教育做好准备。
伯克利 AI 研究(Berkeley AI Research)提出 ABBEL 框架,将交互历史压缩为自然语言信念状态并对其内容进行监督评分,以解决长程任务中上下文无限增长与递归摘要性能下降的问题。
推理成本正以每年9倍至900倍的速度下降,GPT-4级能力从2023年初每百万token约30美元降至1美元以下,部分供应商已压至0.10美元以下。UC Berkeley学者Aditya G. Parameswaran团队提出,数据系统需面向智能体重构:为智能体优化查询复用与近似结果,支撑数千智能体的状态管理与协调,并探索由智能体合成可信数据系统。