Anthropic 正式发布 Claude Opus 5 模型,官方称其性能较前代 Opus 4.8 有显著跃升,在编程和知识工作等多项评测中达到最新领先水平,同时价格较前代保持不变,以一半价格提供接近 Fable 5 的前沿智能。目前该模型已在官方和各类第三方平台上线。
Anthropic 正式发布 Claude Opus 5 模型。已在 Claude Max、Claude Pro 订阅和 Claude API 等平台上线,上下文窗口保持 100 万 token,最大输出 token 数为 12.8 万,定价与 Opus 4.8 相同,为每百万输入 token 5 美元、输出 token 25 美元。官方称 Opus 5 是一次显著升级,在编程和知识工作评测上达到最新领先水平,并以一半价格提供接近 Fable 5 的前沿智能。新模型支持完整的 Effort 推理档位,包括最高档 max,思考模式默认开启,同时推出了对话中途更换工具而不清空缓存、自动安全降级等 beta 功能。在安全方面,Opus 5 被官方称为对齐程度最高的模型,其安全分类器拦截频率比 Fable 5 低约 85%,并在生物领域为科研场景放宽了部分限制。
NVIDIA、Meta和微软等多家公司联合签署公开信,呼吁美国政策制定者避免对开放权重AI模型施加过早的限制。信中指出,开放权重模型能促进行业参与并增强网络安全,合法的蒸馏技术不应与不当行为混为一谈。签署方还包括IBM、Mistral和Hugging Face等,OpenAI和Anthropic未参与签署。
包括Nvidia、Meta、微软、Mistral和Hugging Face在内的多家公司签署了一封公开信,敦促美国政策制定者避免对开放权重AI模型实施广泛的限制。公开信认为,开放权重模型能扩大对AI经济的参与、加强竞争,并通过让网络防御者获得先进能力来增强安全。信中还将蒸馏技术区分为一种合法的技术,与应通过针对性法律框架处理的不当行为分开。签署方包括Andreessen Horowitz、IBM、Palantir等,OpenAI和Anthropic不在其中。
Kimi 官方宣布 Kimi Code Plan 新增 k3-256k 模型ID。该模型适用于日常开发,额度消耗约为 k3 的一半,但不支持视频输入。
Kimi Code Plan 宣布新增 k3-256k 模型ID,旨在应对用户反馈的额度消耗较快问题。官方数据显示,约 90% 的请求上下文长度未超过 256K,针对此类请求使用 k3-256k 模型的消耗仅约为 k3 模型的一半。k3-256k 适用于日常问答、代码补全和常规功能开发,但不支持视频输入;涉及大型代码库分析、超长文档或视频输入时仍建议使用 k3 模型。在模型切换方面,从 k3-256k 直接切换至 k3 不会影响缓存,但从 k3 切换至 k3-256k 前建议手动执行 compact 命令压缩上下文,避免因包含视频文件等原因报错。
Sakana AI发布Fugu-Ultra v1.1多模型编排引擎。新版本可动态协调多款前沿模型,在编程、智能体任务和高级推理基准上全面提升,并新增Claude Code兼容接口。
Sakana AI 宣布推出最新版本的多模型编排引擎 Fugu-Ultra v1.1,并同步发布兼容 Claude Code 的接口。Fugu-Ultra v1.1 通过动态编排前沿模型,在编码、Agentic 任务和高级推理方面展现出更强能力。官方数据显示,该版本较 v1.0 性能最高提升 7.9 分,其中在ProgramBench和Terminal Bench 2.1上的表现尤为突出,在未使用 Fable 5 模型的情况下于复杂任务中表现领先。升级后的系统进一步增强了复杂编程、智能体任务和高级推理能力,价格则维持与上一版本相同。此外,新的 Claude Code 接口允许开发者直接在终端内调用 Fugu 的多模型协作能力。
Midjourney 正式发布 V8.2 图像模型。官方称,更新重点提升图像美学、质量与个性化体验,目前模型已上线可用。
Midjourney 官方博客宣布正式发布 V8.2 图像模型,目前该模型已上线可用。官方表示,为提升用户的创作体验,此次更新重点聚焦于图像的美学表现、整体质量以及个性化功能。根据官方说明,新版生成的图像预期将更具创意、大胆、成熟、前卫和新鲜,且随机出现低质量图像的情况会大幅减少。在个性化能力上,V8.2 能更好地理解用户偏好,尤其是积累了大量评分数据的用户,同时为创建个性化配置文件提供了更大且更完善的图像池。
NVIDIA发布SANA-Video 2.0视频生成模型,包含5B和14B规模。该模型采用混合Linear-Softmax Attention架构从零训练,经Sol-Engine优化,比其他开源视频生成模型生成速度更快。
NVIDIA Research 团队发布了 SANA-Video 2.0 视频视频生成模型,提供 5B 和 14B 两种规模。该模型采用混合 Linear-Softmax Attention 架构,并从零开始训练。在性能表现上,官方数据显示其 VBench 总分为 84.30,5B 模型结合 Sol-Engine 优化后,在单张 H100 上仅需 13.06 秒即可生成 5 秒的 720p 视频。根据团队公布的数据,在同等单张 H100 设置下,其速度比 Wan 2.2-A14B 快 120 倍。
瑞士国家人工智能研究所首个倡议项目 Swiss AI Initiative 发布 Apertus 1.5 多模态语言模型,含 8B 与 70B 两版,支持图像、音频及文本输入。
由苏黎世联邦理工学院 AI 中心和洛桑联邦理工学院 AI 中心合作发起的 Swiss AI Initiative 发布了 Apertus 1.5 系列 8B 和 70B 参数语言模型。该系列在 Apertus 1.0 基础上继续预训练,分别为 8B 模型新增 4T token 多模态数据、为 70B 模型新增 2T token,首次支持图像、音频和文本输入并输出文本,默认上下文长度为 262,144 个 token。模型采用完全开放策略,提供开放权重、开放数据、开放训练细节,并首次引入可选的"思考模式"以增强推理能力。官方表示完整技术报告将在未来几周内公布。
Ollama宣布因需求激增,Ollama正扩充云端算力来迎接下周上线的超大模型。为保障系统响应速度,Ollama暂时停止了Max订阅方案的新用户订阅。
Ollama 官方表示,近期云端对 GLM-5.2 等前沿开源模型的需求激增,公司正在扩充容量以迎接下周上线的超大型模型。为确保基础设施的响应速度,Ollama 暂时停止了 Max 订阅方案的新增订阅。此次暂停不影响现有的 Max 订阅用户,且 Pro 订阅方案仍可正常购买。
OpenRouter推出Classifiers功能公测。该功能可对推理生成按任务类型、部门等维度进行分类标记,帮助追踪Agent行为与成本。
OpenRouter正式推出Classifiers功能,目前处于公测版。用户可在工作区中为每次推理生成添加结构化元数据标签,按任务类型、部门、Agent复杂度等维度进行分类。分类器由四部分组成:最多8个维度的分类体系、分类提示词、分类模型和采样率,并提供6个预设模板。分类在每次请求完成后异步运行,不增加推理路径延迟,即使在输入输出日志记录关闭时仍可工作。结果写入日志并可在Activity Explorer中按维度分组查看,用户可在工作区设置中创建分类器。
Perplexity 官方正式发布 Perplexity CLI ,能赋予编码 Agent 实时搜索网络与抓取网页内容的能力。
Perplexity 官方宣布其命令行工具 Perplexity CLI(pplx)正式上线,旨在赋予编码 Agent 网络搜索与内容抓取能力。开发者可通过 pplx search web 命令进行实时网络搜索,或使用 pplx content fetch 命令获取指定网页的文本内容。
OpenAI 宣布,ChatGPT Work agent 现已支持通过云浏览器登录需要认证的网站,登录状态可跨会话持久保持。目前用户只能在ChatGPT.com上接管云浏览器,且暂不支持passkey登录。
OpenAI Developers官方账号宣布,ChatGPT Work agent现已支持访问需要登录的网站。用户可以接管云浏览器手动登录,随后交由agent继续执行任务,登录状态会在会话间保持,用户只需登录一次。据OpenAI团队成员James Sun介绍,目前云浏览器接管功能仅限ChatGPT.com网页端使用,移动端体验后续将得到改善。该功能暂不支持passkey登录方式,用户需要使用其他方式完成登录。
OpenAI Developers 宣布 ChatGPT 网页版的自定义宠物现已支持分享与领养,用户可生成分享链接发送给朋友领养,也可下载导入桌面客户端。
ChatGPT 网页版的自定义宠物现已支持分享和领养功能。用户在 ChatGPT 网页版创建自定义宠物后,前往个性化设置页面选择"复制链接"即可生成可分享链接,将链接发送给朋友后对方即可领养该宠物。官方表示宠物分享功能目前仅在网页版提供,用户还可以下载将自定义宠物添加到桌面客户端。
SpaceXAI推出Grok for Google Workspace插件。用户安装后,可在Sheets、Slides和Docs的侧边栏直接使用Grok分析数据、生成幻灯片与撰写文档。
SpaceXAI正式推出Grok for Google Workspace插件,用户可从Google Workspace Marketplace免费获取,一次安装即可覆盖Sheets、Slides和Docs。该插件以侧边栏形式在文件旁打开,在Sheets中支持读取选定范围并给出带有单元格引用的解答,在Slides中可根据大纲生成匹配现有主题的可编辑幻灯片,在Docs中能将粗略笔记转为带真实标题和列表的结构化草稿。
TRAE Work 宣布,正式升级并内置 Seedream 5.0 与 Seedance 系列模型。目前,该生图与生视频能力已面向所有用户免费开放,付费会员可享更高的排队优先级。
TRAE Work 宣布,TRAE Work 正式升级并内置了 Seedream 5.0 与 Seedance 系列模型。用户无需挑选模型或进行参数配置,只需通过自然语言即可在工作流中直接生成可用的图片和视频。目前,该功能已在中国版 Work 模式的桌面端与网页端上线,面向所有用户免费开放。能力涵盖文生图、文生视频和图生视频,视频支持多种时长、比例与默认 720P 分辨率。在高峰期可能需要排队或限制使用频次,付费会员可享更高的排队优先级。
智谱宣布智谱清言PC客户端上线。该客户端整合Chat与AgentMore,支持挂载本地文件夹,供AI进行实时同步与跨文件联合分析。
智谱宣布智谱清言PC客户端正式上线,用户可于官网下载。该客户端集成了Chat与AgentMore双核能力,支持一键切换且上下文无缝流转。其核心功能是支持挂载本地文件夹,使AI常驻工作目录,实时感知文件变化并进行跨文件联合分析。挂载机制支持单Agent多文件夹及多Agent并发挂载。同时,AI实施“只读不写”策略,保障本地敏感文件的安全。
Notion 发布“Notion as code”功能。该功能允许用户使用 TypeScript 定义整个工作区,通过 API 部署并支持 Git 版本控制,官方称目前仍在开发中,用户可以申请加入测试。
Notion 发布“Notion as code”功能,现已进入 beta 测试阶段。该功能允许用户使用 TypeScript 代码来定义整个 Notion 工作区,包括团队空间、数据库以及自定义 Agent。用户可以通过 API 部署这些设置,利用编码 Agent 构建工作区,并将配置纳入 Git 进行版本控制,从而在不同环境或工作区复用。目前,用户可以申请加入该 beta 测试,官方表示仍在继续推进该功能的开发工作。
Claude Code 开发者 Thariq 发文,介绍其团队已为最新模型移除超 80% 的 Claude Code 系统提示词且无性能损失,并推出claude doctor 命令协助用户精简配置。
Anthropic 开发团队成员 Thariq 表示,针对 Claude Opus 5 和 Claude Fable 5 等最新模型,团队移除了超过 80% 的 Claude Code 系统提示词。官方评估显示,该精简操作未造成可衡量的性能损失,团队发现新模型在减少过度约束后能更好地运用自身判断力。目前,官方已在 Claude Code 中推出 claude doctor 命令,帮助用户自动精简和调整上下文配置,开发者使用 /doctor 命令即可优化 Skills 与 CLAUDE.md 文件。
Anthropic 官方发布 Claude 模型选择指南,详细说明了 Mythos、Fable、Opus、Sonnet 与 Haiku 模型的特点与适用场景。官方建议开发者优先从最智能的模型起步,并通过调节 effort level 来平衡性能与成本。
Anthropic 官方发布了关于如何为不同工作负载选择 Claude 模型的详细指南,全面介绍了旗下不同级别模型的能力与定位。目前模型家族中,Mythos 与 Fable 是最强大的模型级别,Opus 专注推理密集型企业任务,Sonnet 兼顾日常通用任务,而 Haiku 主打最低成本与最快速度。官方称,由于更智能的模型完成任务所需的轮次和思考时间更少,其“每任务成本”往往更低,因此建议直接从最智能模型起步并向下测试。此外,官方还介绍了利用低成本模型调用智能模型进行验证的 advisor strategy,并建议企业使用自定义评估来测试强大模型。
Anthropic 产品设计师 Nate Parrott 发文分享了 Claude Design 的日常使用经验与最佳实践。该工具目前处于 Beta 阶段,用于早期视觉设计和沟通。
Anthropic 产品设计师 Nate Parrott 在官方博客撰文,分享了视觉设计工具 Claude Design 的日常使用经验与最佳实践。Claude Design 目前处于 Beta 阶段,已在 Claude Pro、Max、Team 和 Enterprise 订阅方案中开放,主要用于制作原型、幻灯片和动画等早期视觉沟通。根据作者说明,该工具不包含图像模型,不适合标志设计,也不替代用于编写生产代码的 Claude Code,但两者支持双向同步。他建议用户在提示前明确需求、上传品牌文件建立设计系统,并通过连接 GitHub 等方式提供真实上下文。
Anthropic 与 Andon Labs 推出 Drone-Bench 基准测试,评估 AI 模型自主控制无人机执行室内人员定位与跟随的能力。官方称 Claude Fable 5 表现最佳。
Anthropic 与合作伙伴 Andon Labs 合作开发了名为 Drone-Bench 的全新基准测试,用于评估 AI 模型自主控制无人机执行定位与跟随人员的监视任务的能力。根据 Anthropic 官方公布的测试结果,Andon Labs 测试了来自三家开发者的 15 个模型,整体趋势表明越新的模型在子任务上完成度越高。其中,表现最好的模型是 Claude Fable 5,它在除重建外的所有任务上都超过了人类与 AI 协作设定的基线,并在真实无人机测试中的检测和跟随环节明显优于基线。由于在重建任务上的错误累积,Claude Fable 5 仍无法自主在房间之间导航。官方指出,该测试仅在室内单一办公室环境中进行,无人机飞行速度缓慢,未涉及复杂的户外场景。
Google发布了“AI与经济ATLAS”报告。该报告基于1500万次去标识化交互数据,展示了用户如何在实际工作与生活中使用其AI工具。
Google正式发布了首份“AI与经济ATLAS”报告。这是一项针对人们如何使用Google AI产品和工具的大规模去标识化研究,其首版数据集(v1.0)基于来自Gemini App、AI Mode和Gemini API的1500万次聚合脱敏人机交互。该数据覆盖超150个国家、140种语言、800种职业和4000项任务。报告指出,职场AI应用广泛但单一职位使用率仅约21%,且不到10%的交互实现了任务完全自动化;同时超86%的AI交互发生在工作之外的家庭场景。
SpaceXAI CEO Elon Musk 宣布 Grok 4.6 将于 2 周后发布,Grok 4.7 将于 4 周后推出。该发布时间表目前为其个人预告,后续实际进展或发生变动。
SpaceXAI 首席执行官 Elon Musk 公布了旗下 Grok 模型的最新发布时间表。根据其说法,Grok 4.6 模型预计将在 2 周后发布,而 Grok 4.7 模型则预计在 4 周后推出。由于该信息来源于马斯克的个人社交媒体发言,目前尚未有官方渠道的正式公告进行补充说明。
据报道,Stripe 正洽谈收购 OpenRouter,交易估值可能约为 100 亿美元。目前谈判仍可能破裂,且存在其他潜在竞购者。
据《华尔街日报》报道,知情人士透露美国金融科技公司 Stripe 正洽谈收购大模型中转站 OpenRouter,交易目前处于洽谈阶段,仍存在破裂或出现其他竞购者的可能。知情人士称,虽然确切价格尚不清楚,但本次收购交易的估值可能达到约 100 亿美元,而 OpenRouter 在最近一轮融资中的估值仅为 13 亿美元。此外,知情人士补充称还有其他大型科技公司也在考虑收购 OpenRouter,且 Stripe 与 OpenRouter 此前已存在支付处理方面的合作。
据报道,腾讯混元多模态模型部门与大语言模型部门合并,成立基础模型部,统一由首席AI科学家姚顺雨管理,探索全模态模型。
据报道,腾讯宣布混元多模态模型部门与大语言模型部门合并,并正式成立基础模型部。新成立的基础模型部统一由腾讯首席AI科学家姚顺雨管理。此次架构调整旨在提升模型研发和协同效率,并探索全模态模型的智能上限。