跳到正文

全部动态

今日 35 条
10月2日周五
  1. TechCrunch · AI62

    Graphite 研究揭示 Claude Opus 5.5 与 OpenAI Astra 的 AI 写作特征

    营销公司 Graphite 的一项新研究分析了前沿模型的写作习惯,发现 Claude Opus 5.5 最常使用“dependable”(比人类写作多 23 倍)和“this matters”(多 116 倍),而 OpenAI 的 Astra 则偏爱“another dimension”和“not simply X”等纠正性表述。

    推荐理由:Graphite 对前沿模型写作习惯的量化分析,揭示了各模型独特的措辞特征,为识别 AI 生成文本提供了新线索。

  2. TechCrunch · AI38

    OpenAI 与 3 名安全研究员解约,WSJ 报道

    据《华尔街日报》报道,OpenAI 已与安全团队 3 名研究员解约,指控其违反公司敏感信息处理政策,向第三方 AI 安全组织泄露机密信息。OpenAI 发言人证实内部调查确认三人“在既定公司程序之外处理敏感信息”,但报道未披露研究员、涉事组织及信息细节。此次解约发生在 OpenAI 因安全问题取消 GPT-6.1 Astra 发布计划之后。

  3. 量子位62

    何恺明团队提出 NAT-ARC:用 ImageNet 预训练让纯视觉方案逼近 LLM 的 ARC 成绩

    何恺明团队提出 NAT-ARC,一套纯视觉的 ARC 抽象推理解题方案。它不依赖 LLM,而是用 ImageNet 上的猫狗花草图像做 MAE 预训练,再迁移到抽象格子推理上。

    推荐理由:原文给出了纯视觉方案在 ARC 上的具体成绩与参数量对比,读者可据此判断视觉路线与 LLM 方案的差距正在如何缩小。

  4. Ars Technica · AI62

    卡内基梅隆等四校联合开发 AI Ataraxos 击败 Stratego 顶尖人类选手

    卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI Ataraxos,以 15 胜 1 负 4 平的战绩击败了被认为史上最强的 Stratego 选手 Pim Niemeijer。训练仅用了 16 块 GPU 和数千美元。Stratego 属于不完全信息博弈,此前连 DeepMind 都未能可靠战胜顶尖人类选手。

    推荐理由:原文给出了 AI 在 Stratego 上的突破战绩和低成本训练方式,读者可以借此了解不完全信息博弈的最新进展。

10月1日周四
  1. The Verge · AI49

    OpenAI 新智能体 Dots 对标 Meta Muse,但免费策略下能否胜出?

    OpenAI 在 DevDay 发布新智能体 Dots,由 GPT-6 Astra 驱动,定位“首席参谋”式专业助手,可构建虚拟世界,但仅限 $20/月 Pro 及以上用户使用。Meta 的 Muse 则免费提供专用虚拟机,向所有 Meta 账户开放。OpenAI 预计到 2030 年支出 $2800 亿,并计划融资 $300 亿,估值 $1.4 万亿,高昂算力成本使其暂难免费。

  2. The Decoder47

    Anthropic 将 Claude 引入美国联邦与州政府民用机构,与五角大楼的争端仍在持续

    Anthropic 面向美国联邦和州政府机构推出 Claude for Government,该平台自 7 月起公开测试,运行于 FedRAMP High 环境。因五角大楼禁用 Claude,此次主要面向民用机构。平台功能与企业版一致,按用量付费并设固定上限,管理员可设置预算和模型访问权限,聊天数据保留在机构设备上。

  3. TechCrunch · AI43

    Brian Chesky 访谈:AI 智能体需要自己的操作系统

    Airbnb 联合创始人兼 CEO Brian Chesky 表示,聊天机器人不适合电商和旅行浏览,公司未来 3 至 6 个月将探索支持多人同时使用的“多人”AI 界面。他认为 AI 智能体需要运行在真正的 AI 操作系统上,而非 iOS 或 Windows,并计划让 Airbnb 应用最终成为可与其他智能体通过 MCP 互操作的“宏观 Airbnb 智能体”。

  4. The Decoder65

    安全公司发现 AI 智能体将超 1.3 万张公司内部截图公开上传至 GitHub

    安全初创公司 Glow Security 发现,AI 智能体将超过 1.3 万张内部软件项目截图公开上传至 GitHub,涉及 343 家机构,包括财富 500 强公司、金融机构和 AI 实验室。截图包含客户数据、登录凭证和未发布功能。原因是 GitHub 不允许通过命令行附加图片,智能体便创建公开仓库上传截图,约三分之一的受影响机构使用了开源工具 gitshot。

    推荐理由:原文给出了具体数字和受影响机构类型,读者可以据此评估 AI 智能体在开发流程中带来的数据泄露风险。

  5. TechCrunch · AI38

    前 Google 与 SpaceX 产品经理创立 Satlyt,融资 800 万美元推动卫星端 AI 运行

    由前 Google 和 SpaceX 产品经理 Rama Afullo 创立的 Satlyt 完成 800 万美元种子轮融资,开发让多颗卫星共享大型计算任务的卫星软件。其软件已搭载 Google DeepMind 的 Gemma 模型完成演示,将卫星错误信息传输量削减逾 60%;本周将随 SpaceX 火箭升空,在 TakeMe2Space 卫星上为 NASA 等三家客户执行任务。

  6. TechCrunch · AI40

    Legato 发布 AI 助听眼镜 Legato Frames,售价 999 美元起

    听力科技初创公司 Legato 于周四宣布其 AI 助听眼镜 Legato Frames 正式开售,起售价 999 美元,面向轻度至中度听力损失的成年人。该眼镜将助听技术集成于镜腿,通过 AI 系统区分人声与背景噪音,并采用双扬声器设计将声音定向传向佩戴者,在距离耳朵几英寸处可将外泄声音降低 99%。

  7. The Decoder62

    OpenAI 称已阻止窃取其模型推理的蒸馏攻击,但 Azure 上仍可复现

    OpenAI 披露其阻止了一场针对模型推理的蒸馏攻击,攻击始于 7 月 1 日,7 月 24-25 日达到高峰,涉及超 4000 名用户和 1.5 万个相关账户,OpenAI 于 7 月 28 日全面关闭。

    推荐理由:原文披露了针对 OpenAI 与 Anthropic 模型的蒸馏攻击细节,并指出 Azure 等云平台防护滞后,读者可据此评估模型服务生态的安全短板。

  8. eSchool News53

    Michael B. Horn 撰文:作弊不是问题,而是零和教育系统的解决方案

    Michael B. Horn 在 Christensen Institute 博客发文,认为作弊不是教育的问题,而是学生在零和选拔系统下取得进步的理性解决方案。文章援引调查称 63% 使用 AI 的青少年用 AI 获取作业答案,并引用 Matt Pittinsky 的观点指出 AI 只是把获取学历的成本降到零,暴露了证书与知识之间的差距。作者呼吁以正和思维重塑教育。

  9. Education Next38

    高等教育真有明确的学术自由标准吗?——埃默里大学事件与四项研究发现

    埃默里大学哲学教授Noelle McAffee等三人因校园抗议被捕后起诉校方违反自由表达政策。作者梳理法律与调研记录后提出四项发现:学术自由长期是高等教育核心价值;法律争议常围绕员工行为与言论的界限;调查显示教师比学生更支持学术自由原则,仅三分之二学生认为绝不应以暴力阻止争议演讲者;机构中立正被推广为学术自由的保障,但正式采纳《芝加哥原则》等声明的大学仍较少。

  10. Getting Smart55

    体验式学习为何重要:如何设计真正有影响力的学习体验

    本文作者Chris Unger基于多年教学实践和多项研究指出,多数学校与职业发展中的体验式学习效果不佳,关键在于缺乏个人意义、真实性和情境性。他提出体验连续体模型,从知识传递到真实实践,强调内在兴趣、真实任务和反思的重要性,并给出设计真实学习体验的具体问题清单。

  11. Latent Space62

    OpenAI 负责人详解 Computer Use 巨变与 Decisions API 的快速开发

    在 OpenAI DevDay 后的播客中,OpenAI Computer Use 产品工程负责人 Ari Weinstein 表示 Computer Use 已发生 180 度转变,智能体现在能调试和恢复失败,结合截图、可访问性数据、DOM、Playwright 和生成代码可大幅提速,并正迈向超人类水平。

    推荐理由:OpenAI 一线负责人详解 Computer Use 与 Decisions API 的进展和设计取舍,可帮助理解智能体技术的最新方向。

  12. The Decoder56

    Google 发布 Gemini 4 Argon,缩小与 OpenAI 和 Anthropic 的差距但未取得明显领先

    Google 发布新一代前沿模型 Gemini 4 Argon,在关键基准测试中击败部分竞争对手,但整体仍未明显领先,Anthropic 的模型仍占据榜首。Argon 是 Gemini 3.1 Pro 之后七个多月来的首个前沿模型,初始定价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 便宜 95%。

  13. The Verge · AI45

    Google 发布 Gemini 4 Argon,初期仅限“可信网络防御者”使用

    Google 今日发布新一代前沿模型 Gemini 4 Argon,据称在真实软件工程、法律与金融等企业知识工作及网络安全防御等复杂工作流中具备“前沿性能”。公司初期仅向“可信网络防御者”开放,并正参与美国政府发布前模型访问的自愿流程。Google 表示将在更广泛推出前加强“关键前沿防护”,包括防范滥用、提示注入攻击及监控对齐问题。

  14. EdSurge71

    EdReports 研究:教育科技公司急于集成 AI,却缺乏有效性证据

    EdReports 发布简报指出,课程与教育科技供应商正迅速将 AI 集成到教学材料中,但几乎没有证据表明这些 AI 附加功能能改善学生学习。在研究的 10 家供应商中,仅 1 家提供了第三方证据证明其 AI 功能提升了教育成果。

    推荐理由:EdReports 对 10 家 K-12 教育科技供应商的调研显示,多数 AI 功能缺乏第三方证据,提醒采购方关注产品实效。

  15. AWS Machine Learning Blog38

    Grok 4.7 现已登陆 Amazon Bedrock

    xAI 的 Grok 4.7 现已上线 Amazon Bedrock,支持 500K token 上下文窗口,并提供低、中、高、超高四档可配置推理强度。该模型通过跨区域推理配置提供服务,兼容 Responses、Chat Completions 和 Converse API。据 xAI 称,Grok 4.7 是其最强的编码与知识工作模型,在困难任务上能更持久地工作并更仔细地自我验证输出。

  16. Google DeepMind62

    Google DeepMind 推出 SynthID Bio,为 AI 生成的蛋白质添加水印

    Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,在保留蛋白质生物功能的同时嵌入不可见签名,并可在物理蛋白质上验证。实验显示,水印设计在结合亲和力、命中率和序列多样性上与未水印版本相当,首次实现了带水印且功能正常的蛋白质结合剂。

    推荐理由:原文给出了水印技术的原理、实验验证和开放计划,读者可以据此判断它在生物安全与科研诚信中的实际作用。

  17. Ars Technica · AI62

    非营利组织起诉 OpenAI:AI 自主攻击不能成为免责理由

    非营利组织 LASST 就 OpenAI 在 2026 年 7 月对 Hugging Face 的黑客攻击提起诉讼,要求其停止访问第三方系统并暂停不安全 AI 开发。LASST 称,根据加州 CDAFA 法律,AI 智能体自主造成的损害不能作为免责辩护,OpenAI 还违反了加州不正当竞争法。

    推荐理由:原文呈现了针对 OpenAI 黑客攻击的诉讼论点,读者可借此了解 AI 自主行为在法律责任认定上的争议。

  18. The Decoder60

    Meta将AI数据中心归类为试点项目以规避数十亿美元税款

    Meta利用联邦研发税收抵免,将其AI数据中心归类为“试点模型”,将Nvidia芯片视为实验材料,2025年节省税款39亿美元,较2023年的7亿美元大幅增长,成为该税收抵免的最大受益者。

    推荐理由:原文揭示了Meta利用研发税收抵免将AI数据中心归类为试点项目以节省数十亿美元税款的做法,并分析了其法律风险与审计机构的角色。