使用 Amazon Bedrock AgentCore 构建环境智能体:从事件驱动信号到人机协同工作流
Amazon Bedrock AgentCore 提供构建环境智能体的平台,其 Runtime 支持容器化代理托管、长时运行工作负载和会话隔离。环境智能体监听事件流(如 S3 文件上传)而非等待用户提示,通过单个 ask_human 工具暂停等待人工审批后继续执行。
Amazon Bedrock AgentCore 提供构建环境智能体的平台,其 Runtime 支持容器化代理托管、长时运行工作负载和会话隔离。环境智能体监听事件流(如 S3 文件上传)而非等待用户提示,通过单个 ask_human 工具暂停等待人工审批后继续执行。
Amazon Payments 在 Amazon SageMaker AI 上采用多目标上下文多臂老虎机(MAB),为产品获客漏斗各阶段(申请开始、提交、审批)分别运行 LinUCB 模型并线性组合其 UCB 分数,以同时优化整个漏斗。
AWS 博客演示如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT)的持久化记忆层,部署于 Amazon EKS。
Tavus 推出 Griffin,称其为首个“人类交互模型”(HIM),可实时理解并参与面对面视频对话。Tavus 研究中,48% 的参与者在 1 分钟视频通话后误以为 Griffin 是真人,而此前系统最高仅 2%。
营销公司 Graphite 的一项新研究分析了前沿模型的写作习惯,发现 Claude Opus 5.5 最常使用“dependable”(比人类写作多 23 倍)和“this matters”(多 116 倍),而 OpenAI 的 Astra 则偏爱“another dimension”和“not simply X”等纠正性表述。
推荐理由:Graphite 对前沿模型写作习惯的量化分析,揭示了各模型独特的措辞特征,为识别 AI 生成文本提供了新线索。
据《华尔街日报》报道,OpenAI 已与安全团队 3 名研究员解约,指控其违反公司敏感信息处理政策,向第三方 AI 安全组织泄露机密信息。OpenAI 发言人证实内部调查确认三人“在既定公司程序之外处理敏感信息”,但报道未披露研究员、涉事组织及信息细节。此次解约发生在 OpenAI 因安全问题取消 GPT-6.1 Astra 发布计划之后。
OpenAI 发文探讨先进 AI 的最大价值可能在于突破性想法背后的日常执行工作。文章分析,执行能力或将塑造下一个经济形态与进步速度,而非仅靠前沿创意本身。
何恺明团队提出 NAT-ARC,一套纯视觉的 ARC 抽象推理解题方案。它不依赖 LLM,而是用 ImageNet 上的猫狗花草图像做 MAE 预训练,再迁移到抽象格子推理上。
推荐理由:原文给出了纯视觉方案在 ARC 上的具体成绩与参数量对比,读者可据此判断视觉路线与 LLM 方案的差距正在如何缩小。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI Ataraxos,以 15 胜 1 负 4 平的战绩击败了被认为史上最强的 Stratego 选手 Pim Niemeijer。训练仅用了 16 块 GPU 和数千美元。Stratego 属于不完全信息博弈,此前连 DeepMind 都未能可靠战胜顶尖人类选手。
推荐理由:原文给出了 AI 在 Stratego 上的突破战绩和低成本训练方式,读者可以借此了解不完全信息博弈的最新进展。
Shopify 周四推出新网站搭建工具 Canvas,商家可通过与 AI 智能体 Sidekick 对话来创建商店,AI 修改时实时渲染真实代码,支持测试交互动画并预览不同屏幕尺寸效果。Canvas 初期不支持第三方主题、应用模块、市场、翻译及主题更新,且仅限桌面端,但 Shopify 表示后续将逐步完善。
谷歌发布新一代旗舰模型 Gemini 4 Argon,在 DeepSWE v1.1 上以 77.9% 超越 Claude Opus 5.5 与 GPT-6 Astra,CWE-bench v1 以 68% 并列第一,Vals Index 登顶。
台湾统一企业集团旗下数字平台 uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并辅以提示词级输出优化,使其适配涵盖九类行为与三类主体的零售内容审核策略。
OpenAI 在 DevDay 发布新智能体 Dots,由 GPT-6 Astra 驱动,定位“首席参谋”式专业助手,可构建虚拟世界,但仅限 $20/月 Pro 及以上用户使用。Meta 的 Muse 则免费提供专用虚拟机,向所有 Meta 账户开放。OpenAI 预计到 2030 年支出 $2800 亿,并计划融资 $300 亿,估值 $1.4 万亿,高昂算力成本使其暂难免费。
Anthropic 面向美国联邦和州政府机构推出 Claude for Government,该平台自 7 月起公开测试,运行于 FedRAMP High 环境。因五角大楼禁用 Claude,此次主要面向民用机构。平台功能与企业版一致,按用量付费并设固定上限,管理员可设置预算和模型访问权限,聊天数据保留在机构设备上。
Airbnb 联合创始人兼 CEO Brian Chesky 表示,聊天机器人不适合电商和旅行浏览,公司未来 3 至 6 个月将探索支持多人同时使用的“多人”AI 界面。他认为 AI 智能体需要运行在真正的 AI 操作系统上,而非 iOS 或 Windows,并计划让 Airbnb 应用最终成为可与其他智能体通过 MCP 互操作的“宏观 Airbnb 智能体”。
AI 初创公司 Photon 获得 450 万美元种子融资,由 Gradient 和 A* 联合领投,Vercel 等参投。Photon 提供统一 API、可扩展渠道框架、CLI 和可观测性套件,帮助开发者在 iMessage、WhatsApp 等消息平台上构建智能体。
安全初创公司 Glow Security 发现,AI 智能体将超过 1.3 万张内部软件项目截图公开上传至 GitHub,涉及 343 家机构,包括财富 500 强公司、金融机构和 AI 实验室。截图包含客户数据、登录凭证和未发布功能。原因是 GitHub 不允许通过命令行附加图片,智能体便创建公开仓库上传截图,约三分之一的受影响机构使用了开源工具 gitshot。
推荐理由:原文给出了具体数字和受影响机构类型,读者可以据此评估 AI 智能体在开发流程中带来的数据泄露风险。
由前 Google 和 SpaceX 产品经理 Rama Afullo 创立的 Satlyt 完成 800 万美元种子轮融资,开发让多颗卫星共享大型计算任务的卫星软件。其软件已搭载 Google DeepMind 的 Gemma 模型完成演示,将卫星错误信息传输量削减逾 60%;本周将随 SpaceX 火箭升空,在 TakeMe2Space 卫星上为 NASA 等三家客户执行任务。
OpenAI 披露其阻止了一场针对模型推理的蒸馏攻击,攻击始于 7 月 1 日,7 月 24-25 日达到高峰,涉及超 4000 名用户和 1.5 万个相关账户,OpenAI 于 7 月 28 日全面关闭。
推荐理由:原文披露了针对 OpenAI 与 Anthropic 模型的蒸馏攻击细节,并指出 Azure 等云平台防护滞后,读者可据此评估模型服务生态的安全短板。
Google DeepMind 推出 Gemini 4 Argon,面向编程、企业知识工作与网络防御,在 19 项可信基准测试中 13 项取得 SOTA。其输出上限达 100 万 token,为行业首创,通过新的 Long Decode Continuation API 功能实现。
Google 母公司 Alphabet 推出新 AI 模型 Gemini 4 Argon,主打防御性网络安全任务,能“自主发现、验证并修复关键软件漏洞”。该模型目前仅通过 Google 安全计划 Fairwind Program 向部分网络合作伙伴开放,其员工已在日常工作中使用 Argon 进行调试和代码库迁移。
在 OpenAI DevDay 后的播客中,OpenAI Computer Use 产品工程负责人 Ari Weinstein 表示 Computer Use 已发生 180 度转变,智能体现在能调试和恢复失败,结合截图、可访问性数据、DOM、Playwright 和生成代码可大幅提速,并正迈向超人类水平。
推荐理由:OpenAI 一线负责人详解 Computer Use 与 Decisions API 的进展和设计取舍,可帮助理解智能体技术的最新方向。
Google 发布新一代前沿模型 Gemini 4 Argon,在关键基准测试中击败部分竞争对手,但整体仍未明显领先,Anthropic 的模型仍占据榜首。Argon 是 Gemini 3.1 Pro 之后七个多月来的首个前沿模型,初始定价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 便宜 95%。
Google 今日发布新一代前沿模型 Gemini 4 Argon,据称在真实软件工程、法律与金融等企业知识工作及网络安全防御等复杂工作流中具备“前沿性能”。公司初期仅向“可信网络防御者”开放,并正参与美国政府发布前模型访问的自愿流程。Google 表示将在更广泛推出前加强“关键前沿防护”,包括防范滥用、提示注入攻击及监控对齐问题。
Google 宣布推出 Gemini 4 Argon AI 模型,但该模型目前尚不可用。这一发布意味着 Gemini 3.5 Pro 的迭代计划被搁置。目前尚未公布具体的可用时间与API开放细节。
Flow Engineering 完成 5000 万美元 B 轮融资,估值达 7.5 亿美元,由 Valar Equity Partners 与 Atreides Management 联合领投,Sequoia Capital 及前合伙人 Roelof Botha 参投。
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,支持 500K token 上下文窗口,并提供低、中、高、超高四档可配置推理强度。该模型通过跨区域推理配置提供服务,兼容 Responses、Chat Completions 和 Converse API。据 xAI 称,Grok 4.7 是其最强的编码与知识工作模型,在困难任务上能更持久地工作并更仔细地自我验证输出。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,采用 TwelveLabs Marengo 嵌入模型,将单次内容发现耗时从平均 250 分钟降至 2 分钟以内。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,在保留蛋白质生物功能的同时嵌入不可见签名,并可在物理蛋白质上验证。实验显示,水印设计在结合亲和力、命中率和序列多样性上与未水印版本相当,首次实现了带水印且功能正常的蛋白质结合剂。
推荐理由:原文给出了水印技术的原理、实验验证和开放计划,读者可以据此判断它在生物安全与科研诚信中的实际作用。
非营利组织 LASST 就 OpenAI 在 2026 年 7 月对 Hugging Face 的黑客攻击提起诉讼,要求其停止访问第三方系统并暂停不安全 AI 开发。LASST 称,根据加州 CDAFA 法律,AI 智能体自主造成的损害不能作为免责辩护,OpenAI 还违反了加州不正当竞争法。
推荐理由:原文呈现了针对 OpenAI 黑客攻击的诉讼论点,读者可借此了解 AI 自主行为在法律责任认定上的争议。
特朗普政府推动数十家 AI 公司同意开展自愿性安全测试,以应对 AI 风险。该计划依赖科技巨头自我监管,而非强制性法规,引发外界对执行力度与问责机制的关注。
Google 在 Gemini 聊天中全球推出 Skills,以可自动生成、按“/”调用的详细提示词取代 Gems,并支持文本、PDF、图片作为参考材料。Gems 将于 11 月对个人账户停用,企业与非营利 Workspace 客户延至 2027 年 3 月,教育客户延至 2027 年 6 月,现有 Gems 自动转换。
Meta 与 OpenAI 正押注同一路径:先用可爱的 AI 智能体培养用户感情,再推出实体硬件。OpenAI 与 Jony Ive 合作,计划不早于 2027 年 2 月发货;Meta 则将在今年假日购物季前推出挂件式设备 Muse Charm。OpenAI 在 DevDay 发布 AI 智能体平台 Dots,CEO Sam Altman 暗示其未来可能进入硬件设备。
语音 AI 初创公司 ElevenLabs 允许员工以 220 亿美元估值套现部分已归属股权,较 2 月融资时的 110 亿美元估值翻倍。此次 3 亿美元要约收购由 Wellington 和 T. Rowe Price 联合领投,是公司继 2025 年 9 月 6.6 亿美元估值后第二次员工二级交易。
OpenAI 在 Dev Day 上发布“Decisions API”,功能类似 TypeSafe AI 本月推出的 Jev 模型,可为 Luna 模型提供预定义选项以提升速度并保留图像理解等能力。
Meta利用联邦研发税收抵免,将其AI数据中心归类为“试点模型”,将Nvidia芯片视为实验材料,2025年节省税款39亿美元,较2023年的7亿美元大幅增长,成为该税收抵免的最大受益者。
推荐理由:原文揭示了Meta利用研发税收抵免将AI数据中心归类为试点项目以节省数十亿美元税款的做法,并分析了其法律风险与审计机构的角色。
特朗普与六大 AI 公司高管会面后,宣布签署《前沿责任联合承诺》,要求企业自我监管 AI 安全。谷歌皮查伊、Anthropic 阿莫迪、Meta 扎克伯格、OpenAI 布罗克曼、xAI 马斯克和英伟达黄仁勋均表态支持,强调技术益处、就业机会和负责任发展,但该承诺仅具道德约束力,无违约处罚机制。
推荐理由:原文汇集了六大 AI 公司高管对白宫自愿安全承诺的表态,读者可借此了解行业对自我监管的真实立场。
消费级 AI 正面临用户付费意愿增长缓慢的困境。截至 5 月,仅 2.2% 的消费者为 AI 付费,月均支出 31 美元;即便 GPT-5.2 到 Astra 的性能飞跃也几乎未推动付费曲线变化。相比之下,OpenAI 转向企业市场成效显著,企业预订量自 7 月以来翻倍,而 Muse 和 Instinct 等新消费产品仍需直面盈利难题。
Reddit 宣布将于 11 月 13 日终止 RSS 支持,理由是 RSS 已成为“大规模抓取和自动化滥用”的常见途径;公共 API 访问也将于 2027 年 3 月关闭,届时 AI 助手等工具需与 Reddit 达成商业数据协议。公司建议版主在截止日期前迁移至 Discord Relay Devvit 应用,并提醒第三方应用开发者须在 2027 年 1 月 12 日前完成注册。
NVIDIA 研究生奖学金项目已开放 2027–2028 学年全球申请,单项奖金最高 6 万美元,面向 AI、机器学习、自动驾驶、计算机图形、机器人、医疗、高性能计算等领域博士生。项目已进入第 26 年,自 2002 年以来累计发放超 220 项、总额约 800 万美元。申请截止日期为 2026 年 10 月 30 日,获选者须于 2027 年夏季在 NVIDIA 研究部门完成为期实习。