跳到正文

#大模型

今日 13 条
9月23日周三
  1. Latent Space40

    John Platt 谈 Google ERA:用 AI 解决可评分科学问题

    在 Latent Space 播客访谈中,John Platt 介绍了 Google 的 Empirical Research Assistance(ERA)——一种基于 Gemini 的 AI 系统,通过维护实验树并利用上置信界规则迭代变异,自动求解可评分的科学问题。ERA 已帮助团队解决多项难题,产出至少十篇论文,包括破解飞机尾迹气候影响建模中困扰团队两年多的难题。

  2. Simon Willison15

    llm-anthropic 0.29 发布

    Simon Willison 发布 llm-anthropic 0.29,为 LLM 命令行工具新增 Anthropic 模型支持。该版本适配 llm 635 与 anthropic 343,用户可通过命令行调用 Claude 系列模型。

9月22日周二
  1. Latent Space60

    小米发布 MiMo-V2.6-Pro 开源全模态模型,1T 参数训练成本约 300 万美元

    小米发布 MiMo-V2.6 系列开源全模态模型,其中 Pro 版以 1.02T 总参数、42B 激活参数成为开源权重模型智能指数榜首,训练成本约 300 万美元。模型采用 MIT 许可,并开源 RL 环境与训练代码,但 7K+ 任务数据集尚未发布。

    推荐理由:原文给出了 MiMo-V2.6 的参数、成本与开源范围,读者可据此判断国产开源模型的竞争力变化。

  2. Simon Willison62

    TypeSafe AI 发布 Jev:输出浮点数的 System One 决策模型

    TypeSafe AI 发布 Jev,一种新型 LLM,接受文本输入但输出浮点数而非文本,用于分类、是非题和评分。Jev 仅按输入计费,价格为每百万 token 0.042 美元,低于 OpenAI GPT-5 Nano。社区已出现基于 Qwen 3.5 的开源复刻 Kev,以及 JevBench 基准。

    推荐理由:原文给出了 Jev 的定价、三种问题类型和开源复刻进展,读者可据此判断这类决策模型适合哪些分类任务。

  3. Latent Space60

    TypeSafe AI 创始人 Diogo Almeida 谈 Jev:System 1 模型、RLCD 与对 RLHF 的批判

    TypeSafe AI 创始人 Diogo Almeida 在 Latent Space 播客中详细介绍了其新模型 Jev 的设计理念。Jev 被定位为面向软件而非聊天的 System 1 模型,核心创新是名为 RLCD 的强化学习技术,旨在优化校准决策而非人类反馈。

    推荐理由:Diogo Almeida 在访谈中系统阐述了 Jev 的设计哲学与 RLCD 路线,读者可借此理解 TypeSafe 对 RLHF 和 RLVR 的批判逻辑。

9月21日周一
  1. OpenAI News18

    OpenAI Academy 新增多条学习路径

    OpenAI Academy 推出面向员工、开发者、领导者、教育工作者和学生的全新学习路径,帮助各群体构建并展示实用 AI 技能。新路径覆盖从基础到进阶的实践内容,支持学习者通过动手项目验证能力,并面向不同角色提供针对性课程设计。

9月19日周六
  1. Latent Space52

    Jev 发布两天出现 6 个复刻项目,Latent Space 盘点各路线与争议

    Latent Space 盘点 Jev 发布两天内出现的 6 个复刻项目,包括基于 ModernBERT 的 Laya、基于扩散模型的 DiffusionGemmaJev、LoRA 微调 Qwen3.5-9B 的 Bespoke Nimble 等,并指出数据侧被忽视且公认 100% 合成。文章还讨论了 Jev 作为非生成式决策模型引发的架构争论,以及浏览器/计算机使用工作流被视为其最佳应用场景。

9月18日周五
9月16日周三
  1. Latent Space60

    游戏中学到的技能能否迁移到真实工作?Good Start Labs 用 1830 游戏实验给出初步答案

    Good Start Labs 联合创始人 Alex Duffy 接受 Latent Space 采访,探讨游戏训练 AI 模型技能能否迁移到真实工作。该公司用 30B 模型在 1830 游戏中训练,结果显示只有终端智能体设计能提升 Finance-Agent 基准表现,而单轮问答设计仅提升游戏内目标。Duffy 认为游戏训练可迁移到结构相似的任务,但迁移的广泛性和可靠性仍是开放问题。

    推荐理由:原文用 1830 游戏实验和 Diplomacy 案例,具体展示了游戏训练如何迁移到金融研究与客服场景,并给出可验证的结果。

9月12日周六
  1. GitHub Blog · AI & ML40

    营销运营即代码:GitHub 上从活动策划到后续跟进的全流程自动化

    GitHub 日韩市场部负责人将活动运营流程改造成代码驱动:用 GitHub Issue 表单收集活动信息、标签触发 GitHub Actions 自动化工作流,并借助 GitHub Copilot 将人工操作手册转化为对话式自动化。活动从策划到会后 CRM 数据整理全程自动执行,无需编写代码,仅依赖事件平台的 API 或 CRM 的 CLI 即可实现。

9月11日周五
9月10日周四
9月9日周三
  1. 芥末堆38

    斑马儿童科教集团亮相2026服贸会 展示「AI赋能儿童教育」的中国样本

    斑马儿童科教集团在2026服贸会展示覆盖2至12岁儿童的AI伴学体系,将AI嵌入英语、思维、阅读等具体学习任务,而非单点问答工具。其自主研发的儿童科教大模型依托万亿级Token教育文本语料训练,已通过国家网信办生成式人工智能服务备案,并建立覆盖数据层、训练层和应用层的全链路安全体系。斑马强调“每天15分钟”短时高频学习,通过能力G值和成长报告持续追踪儿童成长轨迹。

9月8日周二
9月3日周四
9月1日周二
  1. Microsoft Research48

    GigaPath-Flash 与 GigaTIME-Flash:面向人群规模发现的更高效病理学基础模型

    微软研究院推出 GigaPath-Flash 与 GigaTIME-Flash,通过知识蒸馏将十亿参数模型压缩至 22M 参数的 ViT-S 骨干,在 PANDA 和 EBRAINS 基准上以约 50 倍更低的算力实现与原版相差 3% 以内的性能。GigaTIME-Flash 在脑、乳腺、结肠和肺癌的内外分布队列中匹配或超越原版预测质量,两者均以 Apache 2.0 协议开源,仅限研究用途。

8月27日周四
8月13日周四
  1. Microsoft Research38

    MindTopo 基准揭示多模态大模型的空间推理短板

    微软研究院推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离与打结五类任务,并区分静态推理与交互规划两个认知层级。测试显示,当前闭源与开源模型在静态识别上明显强于交互规划,规划阶段常丢失结构关系或提出违反物理约束的动作,整体表现远低于人类水平。该基准旨在为机器人与交互环境中的 AI 系统提供诊断工具。

8月12日周三
8月4日周二
  1. Microsoft Research60

    微软研究院开源 Orchard 智能体框架,小模型在 SWE-bench Verified 达 69.7%

    微软研究院发布开源框架 Orchard,用于可扩展且低成本的智能体 AI 研究,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务。

    推荐理由:原文给出了完整的技术方案、训练数据和基准成绩,读者可以据此评估开源智能体框架的复现成本与能力上限。

7月26日周日
7月7日周二
  1. Berkeley AI Research43

    智能近乎免费之后:面向智能体的数据系统(For、Of、By Agents)

    推理成本正以每年9倍至900倍的速度下降,GPT-4级能力从2023年初每百万token约30美元降至1美元以下,部分供应商已压至0.10美元以下。UC Berkeley学者Aditya G. Parameswaran团队提出,数据系统需面向智能体重构:为智能体优化查询复用与近似结果,支撑数千智能体的状态管理与协调,并探索由智能体合成可信数据系统。

6月9日周二
6月8日周一
5月16日周六
5月12日周二
4月13日周一