跳到正文

#研究/评测

今日 2 条
今天10月6日周二
  1. The Decoder47

    昆尼皮亚克大学民调:多数美国人希望放缓或暂停 AI 发展

    昆尼皮亚克大学民调显示,47% 的美国人希望放缓 AI 发展速度,30% 主张在安全得到验证前完全停止,仅 5% 支持加速。86% 支持正在讨论的独立安全标准,73% 担忧 AI 最终威胁人类生存,74% 对 AI 公司领导者缺乏信任。民调于 9 月 24 日至 27 日调查 1202 名美国成年人,误差为正负 3.5 个百分点。

  2. MIT Technology Review · AI38

    连接 AI 智能体与企业知识:MIT Technology Review 报告解读

    MIT Technology Review 基于 300 位数据、AI 等技术高管的调查,发布报告探讨企业 AI 智能体的知识短板。调查显示,平均仅 34% 的智能体项目进入生产,数据碎片化(55% 提及)是扩大知识访问的首要挑战。报告建议通过知识层、检索技术(如 RAG)和知识图谱强化数据与智能体的连接。

10月4日周日
  1. The Decoder48

    Google 研究人员找到防止自我改进 AI 智能体记住测试任务的方法

    Google 研究人员提出 RRSI(正则化递归自我改进智能体框架),通过限制编辑预算和严格审查机制,防止 AI 智能体在自我优化过程中记忆测试任务。在 8 个基准测试中,RRSI 在未见过的任务上最高提升 4.7 分,运行时 token 消耗减少约 30%,且性能从未低于基线。相关代码已在 GitHub 开源。

10月3日周六
10月2日周五
  1. 量子位64

    arXiv 发布每月最多提交 2 篇论文的新规,拒稿不退额度

    arXiv 自 2026 年 10 月 1 日起实施新规,每位提交者每月最多提交 2 篇论文,且无论是否通过审核均占用额度,所有分类共享此限制。arXiv 表示此举旨在应对 AI 工具导致论文数量激增、审核压力过大的问题,并计划未来升级审核工具与流程。

    推荐理由:arXiv 新规直接改变论文投稿节奏,读者可借此判断 AI 时代科研产出与审核的平衡走向。

  2. 量子位65

    丘成桐新论文致谢 GPT 和 Claude,AI 辅助解决 44 年前悬而未决的怪球问题

    丘成桐参与的最新论文在致谢中感谢了 GPT 6 Astra 和 Claude Pro 在部分证明策略探索和计算中的帮助。该论文宣称解决了七维空间中 27 种怪球能否配备正截面曲率度量的经典猜想,该问题自 1982 年被丘成桐列入问题清单以来悬而未决。论文附带 SageMath 验证代码,计算机验证成为证明可信度的重要支撑。

    推荐理由:丘成桐从质疑到使用 AI 辅助证明的转变,为理解 AI 在尖端数学研究中的角色提供了真实案例。

  3. TechCrunch · AI62

    Graphite 研究揭示 Claude Opus 5.5 与 OpenAI Astra 的 AI 写作特征

    营销公司 Graphite 的一项新研究分析了前沿模型的写作习惯,发现 Claude Opus 5.5 最常使用“dependable”(比人类写作多 23 倍)和“this matters”(多 116 倍),而 OpenAI 的 Astra 则偏爱“another dimension”和“not simply X”等纠正性表述。

    推荐理由:Graphite 对前沿模型写作习惯的量化分析,揭示了各模型独特的措辞特征,为识别 AI 生成文本提供了新线索。

  4. 量子位62

    何恺明团队提出 NAT-ARC:用 ImageNet 预训练让纯视觉方案逼近 LLM 的 ARC 成绩

    何恺明团队提出 NAT-ARC,一套纯视觉的 ARC 抽象推理解题方案。它不依赖 LLM,而是用 ImageNet 上的猫狗花草图像做 MAE 预训练,再迁移到抽象格子推理上。

    推荐理由:原文给出了纯视觉方案在 ARC 上的具体成绩与参数量对比,读者可据此判断视觉路线与 LLM 方案的差距正在如何缩小。

  5. Ars Technica · AI62

    卡内基梅隆等四校联合开发 AI Ataraxos 击败 Stratego 顶尖人类选手

    卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI Ataraxos,以 15 胜 1 负 4 平的战绩击败了被认为史上最强的 Stratego 选手 Pim Niemeijer。训练仅用了 16 块 GPU 和数千美元。Stratego 属于不完全信息博弈,此前连 DeepMind 都未能可靠战胜顶尖人类选手。

    推荐理由:原文给出了 AI 在 Stratego 上的突破战绩和低成本训练方式,读者可以借此了解不完全信息博弈的最新进展。

10月1日周四
  1. The Decoder65

    安全公司发现 AI 智能体将超 1.3 万张公司内部截图公开上传至 GitHub

    安全初创公司 Glow Security 发现,AI 智能体将超过 1.3 万张内部软件项目截图公开上传至 GitHub,涉及 343 家机构,包括财富 500 强公司、金融机构和 AI 实验室。截图包含客户数据、登录凭证和未发布功能。原因是 GitHub 不允许通过命令行附加图片,智能体便创建公开仓库上传截图,约三分之一的受影响机构使用了开源工具 gitshot。

    推荐理由:原文给出了具体数字和受影响机构类型,读者可以据此评估 AI 智能体在开发流程中带来的数据泄露风险。

9月23日周三
9月16日周三
8月4日周二
  1. Microsoft Research60

    微软研究院开源 Orchard 智能体框架,小模型在 SWE-bench Verified 达 69.7%

    微软研究院发布开源框架 Orchard,用于可扩展且低成本的智能体 AI 研究,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务。

    推荐理由:原文给出了完整的技术方案、训练数据和基准成绩,读者可以据此评估开源智能体框架的复现成本与能力上限。