跳到正文

#大模型

今日 13 条
10月3日周六
10月2日周五
  1. The Verge · AI40

    AI 音乐工具 Suno 新增语音生成功能

    Suno 推出 Speech 功能,可根据脚本或提示描述生成语音,并支持同时生成配音与背景音乐,现已面向网页和移动端开放公测。该功能提供 Simple 和 Advanced 两种模式,可调节音色、语音风格等,最长约八分钟。Suno 表示将根据用户反馈持续改进。

  2. The Decoder38

    Black Forest Labs 发布 Flux 3 Image,支持多步编辑且不改变图像其他部分

    Black Forest Labs 发布 Flux 3 模型家族的图像模型 Flux 3 Image,支持多步编辑且不改变图像其他部分,覆盖文生图、图生图、文本渲染和照片级真实感。用户可用边界框构图、最多引用十张参考图,输出最高 4K 分辨率。API 访问在 10 月 8 日前享五折优惠,商业权重可授权企业自建基础设施运行和微调,开源权重版本预计数周内推出。

  3. MIT Technology Review · AI66

    AlphaGo 核心成员 Thore Graepel:LLM 并不真正推理

    前 AlphaGo 核心成员、UCL 机器学习教授 Thore Graepel 撰文指出,当前 LLM 的链式思考仍属系统 1 直觉,缺乏显式认知状态与知识操作分离,不构成真正推理。他主张借鉴 AlphaGo 的搜索架构,构建可审计的推理系统,并为此离开 Google DeepMind。

    推荐理由:作者以 AlphaGo 核心成员身份对比 AlphaGo 搜索与 LLM 推理,提出可审计的推理架构方向,适合关注 AI 可靠性的读者。

  4. AWS Machine Learning Blog38

    用 Amazon Bedrock AgentCore 上的智能体扩展云迁移:四智能体模式将 IaC 开发从 3-4 周压缩至分钟级

    AWS 在 Amazon Bedrock AgentCore 上提出四智能体模式,将云迁移中基础设施即代码(IaC)开发时间从每应用 3-4 周缩短至分钟级。该模式与 AWS Transform 及 AWS DMS 协同,通过 MCP 工具连接内部系统,覆盖迁移与运维两大流程,适用于 300+ 应用的大型迁移项目。

  5. The Verge · AI47

    Google 在 Gemini Live 推出 Guided Vision,用 AI 实时语音描述镜头画面

    Google 今日在兼容 Android 设备的 Gemini Live 中推出 Guided Vision,通过共享摄像头让 AI 实时语音描述画面,帮助阅读小字、识别物体与描述环境。该功能面向盲人、低视力用户及特定场景需求者,并可在 Google TalkBack 或 Android 9 及以上设备的辅助功能快捷方式中使用。Google 提醒用户勿将其用于导航、安全出行或障碍物检测。

  6. TechCrunch · AI38

    Google 认为 SpaceX 的 Starship 需发射约 1,800 次才能让太空数据中心落地

    Google 的轨道计算卫星原型今日搭载 SpaceX 火箭升空,将验证其 TPU 芯片能否在太空运行。Google 发布的白皮书预计,Starship 需在未来十年完成约 1,800 次发射(每年 180 次)才能以低成本将计算送入轨道。测试显示芯片在辐射环境下推理错误率约为百万分之一,但大规模训练仍面临挑战。

  7. TechCrunch · AI38

    ChatGPT 推出虚拟试衣与收藏功能,基于 ChatGPT Images 2.5 模型

    OpenAI 面向全球用户推出 ChatGPT 两项购物新功能:虚拟试衣和收藏(Favorites)。虚拟试衣基于新发布的 ChatGPT Images 2.5 模型,用户上传自拍或全身照即可预览服装与配饰上身效果,购物结果中新增“try on”按钮;收藏功能可将商品保存至应用内 Library 供后续查看。此前 OpenAI 曾放弃即时结账功能,而 Google 已于去年推出虚拟试衣。

  8. AWS Machine Learning Blog42

    在 AWS 上为 Claude Platform 实现多环境访问

    AWS 机器学习博客发布分步指南,为 Claude Platform on AWS(CPonAWS)配置多环境访问。方案采用专用 AI Services 账户模式,通过跨账户 SigV4 支持 AWS 工作负载、工作区级 API 密钥供开发者本地使用、OIDC 联合认证支持外部环境,实现生产与开发流量隔离并共享单一订阅。

  9. TechCrunch · AI62

    Graphite 研究揭示 Claude Opus 5.5 与 OpenAI Astra 的 AI 写作特征

    营销公司 Graphite 的一项新研究分析了前沿模型的写作习惯,发现 Claude Opus 5.5 最常使用“dependable”(比人类写作多 23 倍)和“this matters”(多 116 倍),而 OpenAI 的 Astra 则偏爱“another dimension”和“not simply X”等纠正性表述。

    推荐理由:Graphite 对前沿模型写作习惯的量化分析,揭示了各模型独特的措辞特征,为识别 AI 生成文本提供了新线索。

  10. 量子位62

    何恺明团队提出 NAT-ARC:用 ImageNet 预训练让纯视觉方案逼近 LLM 的 ARC 成绩

    何恺明团队提出 NAT-ARC,一套纯视觉的 ARC 抽象推理解题方案。它不依赖 LLM,而是用 ImageNet 上的猫狗花草图像做 MAE 预训练,再迁移到抽象格子推理上。

    推荐理由:原文给出了纯视觉方案在 ARC 上的具体成绩与参数量对比,读者可据此判断视觉路线与 LLM 方案的差距正在如何缩小。

10月1日周四
  1. The Verge · AI49

    OpenAI 新智能体 Dots 对标 Meta Muse,但免费策略下能否胜出?

    OpenAI 在 DevDay 发布新智能体 Dots,由 GPT-6 Astra 驱动,定位“首席参谋”式专业助手,可构建虚拟世界,但仅限 $20/月 Pro 及以上用户使用。Meta 的 Muse 则免费提供专用虚拟机,向所有 Meta 账户开放。OpenAI 预计到 2030 年支出 $2800 亿,并计划融资 $300 亿,估值 $1.4 万亿,高昂算力成本使其暂难免费。

  2. TechCrunch · AI43

    Brian Chesky 访谈:AI 智能体需要自己的操作系统

    Airbnb 联合创始人兼 CEO Brian Chesky 表示,聊天机器人不适合电商和旅行浏览,公司未来 3 至 6 个月将探索支持多人同时使用的“多人”AI 界面。他认为 AI 智能体需要运行在真正的 AI 操作系统上,而非 iOS 或 Windows,并计划让 Airbnb 应用最终成为可与其他智能体通过 MCP 互操作的“宏观 Airbnb 智能体”。

  3. TechCrunch · AI38

    前 Google 与 SpaceX 产品经理创立 Satlyt,融资 800 万美元推动卫星端 AI 运行

    由前 Google 和 SpaceX 产品经理 Rama Afullo 创立的 Satlyt 完成 800 万美元种子轮融资,开发让多颗卫星共享大型计算任务的卫星软件。其软件已搭载 Google DeepMind 的 Gemma 模型完成演示,将卫星错误信息传输量削减逾 60%;本周将随 SpaceX 火箭升空,在 TakeMe2Space 卫星上为 NASA 等三家客户执行任务。

  4. The Decoder62

    OpenAI 称已阻止窃取其模型推理的蒸馏攻击,但 Azure 上仍可复现

    OpenAI 披露其阻止了一场针对模型推理的蒸馏攻击,攻击始于 7 月 1 日,7 月 24-25 日达到高峰,涉及超 4000 名用户和 1.5 万个相关账户,OpenAI 于 7 月 28 日全面关闭。

    推荐理由:原文披露了针对 OpenAI 与 Anthropic 模型的蒸馏攻击细节,并指出 Azure 等云平台防护滞后,读者可据此评估模型服务生态的安全短板。

  5. Latent Space62

    OpenAI 负责人详解 Computer Use 巨变与 Decisions API 的快速开发

    在 OpenAI DevDay 后的播客中,OpenAI Computer Use 产品工程负责人 Ari Weinstein 表示 Computer Use 已发生 180 度转变,智能体现在能调试和恢复失败,结合截图、可访问性数据、DOM、Playwright 和生成代码可大幅提速,并正迈向超人类水平。

    推荐理由:OpenAI 一线负责人详解 Computer Use 与 Decisions API 的进展和设计取舍,可帮助理解智能体技术的最新方向。

  6. The Decoder56

    Google 发布 Gemini 4 Argon,缩小与 OpenAI 和 Anthropic 的差距但未取得明显领先

    Google 发布新一代前沿模型 Gemini 4 Argon,在关键基准测试中击败部分竞争对手,但整体仍未明显领先,Anthropic 的模型仍占据榜首。Argon 是 Gemini 3.1 Pro 之后七个多月来的首个前沿模型,初始定价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 便宜 95%。

  7. The Verge · AI45

    Google 发布 Gemini 4 Argon,初期仅限“可信网络防御者”使用

    Google 今日发布新一代前沿模型 Gemini 4 Argon,据称在真实软件工程、法律与金融等企业知识工作及网络安全防御等复杂工作流中具备“前沿性能”。公司初期仅向“可信网络防御者”开放,并正参与美国政府发布前模型访问的自愿流程。Google 表示将在更广泛推出前加强“关键前沿防护”,包括防范滥用、提示注入攻击及监控对齐问题。

  8. AWS Machine Learning Blog38

    Grok 4.7 现已登陆 Amazon Bedrock

    xAI 的 Grok 4.7 现已上线 Amazon Bedrock,支持 500K token 上下文窗口,并提供低、中、高、超高四档可配置推理强度。该模型通过跨区域推理配置提供服务,兼容 Responses、Chat Completions 和 Converse API。据 xAI 称,Grok 4.7 是其最强的编码与知识工作模型,在困难任务上能更持久地工作并更仔细地自我验证输出。

  9. Ars Technica · AI40

    Google 向网站支付 AI 答案费用的试点计划遇冷

    Google 的 AI 贡献试点计划已吸纳约 100 家出版商,当内容实质性地用于 Gemini 驱动的搜索结果(如 AI Overview)时,网站可获得付款。但据 The Information 报道,中小出版商获得的金额微薄,仅相当于其广告收入的约千分之一,多家大型出版商已拒绝参与,希望迫使 Google 提供更优厚的条件。

9月30日周三
  1. AWS Machine Learning Blog38

    用自然语言查询理赔记录:Amazon Bedrock Knowledge Bases 实战指南

    Amazon Bedrock Knowledge Bases 提供全托管 RAG 能力,通过 AgenticRetrieveStream API 支持自然语言查询理赔文档,并返回带引用的答案。方案从 Amazon S3 摄取 PDF、Word 等格式的理赔记录,支持多轮追问、元数据过滤和上下文接地护栏,确保答案有据可查。文中使用合成理赔数据演示,未涉及生产客户部署。