GLM 5.3 登陆 Amazon Bedrock
GLM 5.3 已上线 Amazon Bedrock,该模型为 Z.ai(智谱 AI)推出的 753B 参数混合专家模型,针对编码与长时智能体任务优化,并展现出突出网络安全能力。用户可通过完全托管的 API 调用,支持跨区域推理、提示词缓存与服务层级,无需管理基础设施。Z.ai 称其在 CyberGym 基准上取得 84.5 分,编码能力较 GLM 5.2 提升 50%。
GLM 5.3 已上线 Amazon Bedrock,该模型为 Z.ai(智谱 AI)推出的 753B 参数混合专家模型,针对编码与长时智能体任务优化,并展现出突出网络安全能力。用户可通过完全托管的 API 调用,支持跨区域推理、提示词缓存与服务层级,无需管理基础设施。Z.ai 称其在 CyberGym 基准上取得 84.5 分,编码能力较 GLM 5.2 提升 50%。
Amazon SageMaker AI 推出 aws-ai-ml 技能,可通过 Agent Toolkit for AWS 安装,让 Kiro、Claude Code、Codex 等编码智能体具备推理优化与基准测试能力,自动生成可执行的 SageMaker Python SDK v3 代码。
Claude Opus 5.5 和 Claude Sonnet 5.5 在 AWS GovCloud(US)区域上线,支持 ITAR 等合规工作负载的 AI 辅助开发。
Amazon Bedrock AgentCore Evaluations 作为托管能力,可评估多智能体系统在准确性、任务成功率和行为等多维度的表现,并支持内置与自定义评估器。
AWS 博客展示了如何在 Amazon Bedrock Managed Knowledge Base 上构建基于 LangChain 的 RAG 应用,对比标准 Retrieve API 与 AgenticRetrieveStream API 两种检索路径。
AWS 发布 Quick Resource Migrator,一个基于 Amazon Bedrock AgentCore 的 MCP 服务器示例,可在单个工具调用中自动化 Amazon Quick 资源(代理、连接器、知识库、流和空间)从开发账户到生产账户的跨账户提升。
OpenAI 在 ChatGPT 中推出新的视觉广告格式,并同步扩展广告测量工具、归因合作伙伴关系及品牌适用性功能,为广告主提供更完整的投放与效果评估方案。
OpenAI 发布 GPT-6 家族模型选用指南,面向初创企业讲解如何按需选择 GPT-6 系列模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备 AI 工作流。指南覆盖从模型选型到部署落地的完整路径,帮助开发团队在真实业务场景中更高效地使用 GPT-6。
Amazon SageMaker AI 推出多轮强化学习(MTRL)能力,用于微调搜索智能体。该方法以 Qwen3.6-27B 为基座模型,通过 BM25 与向量搜索两种工具,在 FRAMES、BRIGHT 和 Enterprise RAG 数据集上训练,支持 PPO、CISPO 等算法及无服务器按 token 计费,旨在以小型模型的成本获得接近前沿模型的检索可靠性。
AWS 提出 Adjudicated Query 设计模式,让业务人员通过 Amazon Quick 聊天界面提出合规问题,而通过/不通过的判定由确定性规则引擎完成,模型仅负责翻译问题与叙述结果,不参与最终裁决。
NVIDIA 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等合作伙伴推出 64GB 统一内存版 DGX Spark,起售价 $4,999。
GPT-6 Astra Ultrafast 已上线 OpenAI API,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行于 NVIDIA Blackwell GPU 上。
AWS 在 Amazon Bedrock AgentCore 上提出四智能体模式,将云迁移中基础设施即代码(IaC)开发时间从每应用 3-4 周缩短至分钟级。该模式与 AWS Transform 及 AWS DMS 协同,通过 MCP 工具连接内部系统,覆盖迁移与运维两大流程,适用于 300+ 应用的大型迁移项目。
AWS 机器学习博客发布分步指南,为 Claude Platform on AWS(CPonAWS)配置多环境访问。方案采用专用 AI Services 账户模式,通过跨账户 SigV4 支持 AWS 工作负载、工作区级 API 密钥供开发者本地使用、OIDC 联合认证支持外部环境,实现生产与开发流量隔离并共享单一订阅。
Amazon Bedrock AgentCore 提供构建环境智能体的平台,其 Runtime 支持容器化代理托管、长时运行工作负载和会话隔离。环境智能体监听事件流(如 S3 文件上传)而非等待用户提示,通过单个 ask_human 工具暂停等待人工审批后继续执行。
Amazon Payments 在 Amazon SageMaker AI 上采用多目标上下文多臂老虎机(MAB),为产品获客漏斗各阶段(申请开始、提交、审批)分别运行 LinUCB 模型并线性组合其 UCB 分数,以同时优化整个漏斗。
AWS 博客演示如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT)的持久化记忆层,部署于 Amazon EKS。
台湾统一企业集团旗下数字平台 uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并辅以提示词级输出优化,使其适配涵盖九类行为与三类主体的零售内容审核策略。
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,支持 500K token 上下文窗口,并提供低、中、高、超高四档可配置推理强度。该模型通过跨区域推理配置提供服务,兼容 Responses、Chat Completions 和 Converse API。据 xAI 称,Grok 4.7 是其最强的编码与知识工作模型,在困难任务上能更持久地工作并更仔细地自我验证输出。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,采用 TwelveLabs Marengo 嵌入模型,将单次内容发现耗时从平均 250 分钟降至 2 分钟以内。
CoreWeave 在 Fully Connected 大会上宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网可用,Cognition 成为首个在 Vera Rubin 上运行生产负载的客户,其 SWE-2 推理工作负载的 token 总吞吐量较 GB200 NVL72 提升最高 4.8 倍。
Amazon Bedrock Knowledge Bases 提供全托管 RAG 能力,通过 AgenticRetrieveStream API 支持自然语言查询理赔文档,并返回带引用的答案。方案从 Amazon S3 摄取 PDF、Word 等格式的理赔记录,支持多轮追问、元数据过滤和上下文接地护栏,确保答案有据可查。文中使用合成理赔数据演示,未涉及生产客户部署。
Amazon Bedrock AgentCore 新增 Runtime Instances 计算选项,支持最长 14 天的多智能体会话、GPU 访问与持久存储,区别于 MicroVM 的 8 小时上限。
Amazon Bedrock 宣布 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5 在印度可用,通过地理跨区域推理在印度区域(仅限 ap-south-1 和 ap-south-2 之间)处理数据,满足本地数据处理要求。
Amazon Bedrock 现已在首尔和新加坡区域支持区域内推理,提供 Claude Opus 5 和 Claude Sonnet 5 模型,满足金融、医疗和公共部门的数据本地化需求。
GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,为编码、计算机使用和专业工作负载带来更强的推理能力。据 OpenAI 称,GPT-6.1 Sol 在 DeepSWE v1.1 上以约五分之一的任务成本达到 GPT-6 Astra 的水平,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。
AWS 发布 Amazon Quick 提示词工程基础系列文章的第一部分,讲解跨平台 AI 功能通用的提示词原则与可复用框架。核心方法包括用具体细节消除歧义、提供业务上下文、以示例替代描述,以及采用 CRISPE 框架(上下文、角色、意图、步骤、范围等)组织复杂请求。系列第二部分将深入 Research 等各组件的专项技巧。
AWS 官方博客详解 Amazon Quick 各组件的提示词编写差异。Quick Research 需明确目标、受众与子问题,可调用 Quick Index、200+ 新闻源及 S&P Global、FactSet、PubMed 等数据源;Quick Flows 建议用编号步骤描述触发条件与分支逻辑;Quick Sight 查询需包含业务问题、指标与维度。
AWS 发布基于 Amazon Quick 和 Amazon Bedrock AgentCore 的合同智能平台参考架构。该平台用 AI 智能体从合同 PDF 中提取八类关键字段,并由独立验证智能体复核,签名分歧由 Amazon Textract 以计算机视觉裁决,结果存入 Amazon Aurora PostgreSQL。
微软亚洲研究院(新加坡)迎来成立一周年,该实验室于2025年7月24日启用,是微软在东南亚的首个研究实验室。一年来,实验室围绕下一代AI模型与智能体系统、领域特定AI、AI原生研究实践及生态与人才发展四大支柱开展工作,并与新加坡经济发展局(EDB)合作开展博士培养项目。其研究重点包括多模态医疗AI和自进化诊断智能体,旨在推动AI从实验室走向医疗、教育等领域的实际应用。
Claude Sonnet 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上正式可用,面向聚焦编码与知识工作,以更快速度实现大多数任务更低的单任务成本。
本教程演示如何在 Amazon SageMaker AI 上部署 Qwen3-TTS 模型,通过 AWS vLLM-Omni 深度学习容器实现边生成边播放的流式语音输出。
本教程展示如何在 Amazon SageMaker AI 上部署两个 vLLM-Omni 端点,实现从文本提示生成图像并进一步生成短视频。实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像转为视频,输出 MP4 存储于 Amazon S3。
AWS 提出用 Amazon Nova Act 与 Amazon Bedrock AgentCore 构建智能体驱动的合成监控方案,替代 Selenium、Playwright 等依赖 DOM 选择器的脆弱脚本。
AWS 提出一种结合 Amazon EKS、EFA 与 DeepEP 的架构,用于加速 MoE 模型的大规模强化学习后训练,吞吐量提升 40%。该方案通过 DeepEP 优化 EFA 上的专家并行通信,并协调 rollout 生成与策略训练的异构算力需求,应对 RLHF 与 GRPO 训练中的通信瓶颈。
AWS 在 SageMaker HyperPod 上演示了如何用开源强化学习框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型。通过 GRPO 算法,模型在 64 个迷宫测试集上的解决率从 43.75% 提升至 95% 以上。该方案利用 HyperPod 的集群弹性、Ray 集成和 Amazon Managed Grafana 监控,支持多节点长时间训练。
AWS 在 Amazon Bedrock 上为 NarrateAI 引入五项生产级质量保障技术,包括自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架与数据准确性验证,服务超 4,000 名 AWS 高管。该方案通过两阶段级联检测数值幻觉,在实时流式响应下实现约 99% 的数值准确率。
Qwen3-TTS-12Hz-1.7B-Base 现可通过 Amazon SageMaker JumpStart 部署到全托管实时推理端点,实现基于数秒参考音频的语音克隆,无需重新训练模型。该模型支持 10 种语言及跨语言克隆,输出 24 kHz 音频,适用于教育、媒体等场景,并支持流式生成。部署后数据保留在 AWS 环境中,可通过 CloudWatch 监控端点规模。
微软研究院研究显示,将物理 AI 推理从机器人板载 GPU 卸载至边缘或云端 GPU,可显著提升任务成功率、支持更大模型并延长电池寿命。在移动操作测试中,板载 GPU 使导航障碍检测延迟降低 30%、VLA 模型准确率下降 50%,而 Jetson Thor 等 GPU 耗电最高达 160%。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示从零创建角色声音,并可在 Google AI Studio、Gemini API 等平台使用。