Epoch 0
JA · EN
每日 AI 日报
2026-09-02
来源:橘鸦 AI 早报 · 16 条
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1
要闻
Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1:Fable 已全面开放,典型按 token 计费负载预计便宜 25%,高 Agent 化任务最多约 45%;Mythos 仅限可信访问计划。
Anthropic 已发布 Claude Fable 5.1 和 Claude Mythos 5.1,前者现已全面开放,后者仅通过可信访问计划提供。两者使用同一模型,但采用不同级别的 safeguards;据其说明,Mythos 5.1 的 safeguards 面向网络安全和生命科学工作。官方预计,在按 token 计费的典型工作负载中,Fable 5.1 比 Fable 5 便宜 25%,原因是 cache read 定价下调;高 Agent 化任务通常可节省更多,最多约 45%。Claude Code 默认使用 High effort,Claude Cowork 和 Claude.ai 默认使用 Medium effort。
Anthropic 同时公布了 Enterprise Frontier Safeguards(EFS)。官方表示,EFS 将数据存放在完全由客户而非 Anthropic 控制的云基础设施中,可提供与 zero data retention policy 相同的隐私水平,并将分阶段向企业客户开放;在 EFS 可用前,符合条件的客户可通过 zero data retention 使用 Fable 5.1。新版网络安全 safeguards 的误拦数量比此前减少 60%,允许模型发现软件漏洞,但不允许其开发 exploit。Anthropic 还与美国政府合作建立了生命科学访问计划。据其说明,Millennium 在测试中使用 Fable 5.1 找到了内部系统一次罕见崩溃的原因,而其工程师和其他模型此前数年均未能解释该问题。
读原文 →
OpenAI 宣布 Astra 即将发布
要闻
OpenAI 披露新模型 Astra 的发布计划。官方称其在 ExploitBench 评测中获得 100%,内部测试发现并利用了 2 个零日漏洞,成为其首个达到网络安全“Critical”门槛的模型。
OpenAI 宣布正准备发布新模型 Astra,并计划近期开放,最先进的网络安全能力初期仅向部分测试者提供。据其说明,Astra 是其首个达到 Preparedness Framework 网络安全“Critical”门槛的模型,在获得相应工具和权限后,可发现未知安全漏洞并开发利用方式。官方评测中,Astra 在 ExploitBench 获得 100%;官方还称,内部测试发现并利用了 2 个零日漏洞,专家测试则完成了浏览器沙箱逃逸,以及从普通用户到 root 的操作系统提权链。
为准备发布,OpenAI 推迟了 Astra 的部分开发及发布工作,并强化模型拒答、系统安全分类、训练基础设施隔离、跨会话监控和未授权行为检测。据其说明,Astra 在对齐测试中更能遵守安全限制和授权范围,配套的推理与行为监控也将用于生产环境。最先进的网络安全能力之后将通过 Daybreak Blue 扩大防御性使用;安全系统可能暂停或终止被判定存在风险的正常任务。
读原文 →
Gemini 3.7 Flash 等三款模型上线 Agentic 视频理解
要闻
Google 在三款 Gemini Flash 模型上线 Agentic 视频理解;官方称该功能最多减少 88% token、降低 66% 成本,并将准确率最多提高 7%。
Google 已在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线 Agentic 视频理解,发布时即可通过 Gemini API 在 Google AI Studio 或 Gemini Enterprise Agent Platform 处理上传视频和 YouTube 视频。开发者需在 API configuration 中将 processing 设为“agentic”;该功能沿用标准 Gemini API token pricing,不另收功能费。据其说明,模型会结合核心推理与 native video tools,在 visual frames、audio 和 transcript 间动态搜索、扫描并检查目标片段,而非按默认 1 FPS、可通过 API 调整的固定速率处理视频。
官方表示,在标准视频分析 benchmark 中,三款模型启用该功能后,token consumption 最多减少 88%,analysis costs 最多降低 66%,accuracy 最多提高 7%;其中 Gemini 3.7 Flash 的整体 quality 最高,并在受测模型中处于 accuracy-to-cost Pareto frontier。该机制可按任务决定查看哪些片段、采用何种速度以及使用 visual frames、audio 或 transcript,并支持 sub-second moment retrieval、anomaly detection 和 counting。官方还表示,该功能将很快覆盖 Gemini app 中 Flash 与 Flash-Lite 模型的全部用户,并在未来数月用于视频观看页的 YouTube“Ask YouTube”功能。
读原文 →
智谱庆祝 GLM Coding Plan 一周年向订阅用户发放重置卡
开发生态
智谱在 GLM Coding Plan 上线一周年之际,向每位当前订阅用户发放 1 张重置卡,可补满周配额和 5 小时配额,卡券有效期至 2026 年 10 月 1 日。
GLM Coding Plan 上线满一周年时,智谱宣布为所有当前订阅用户各提供 1 张重置卡,卡券有效至 2026 年 10 月 1 日。该卡能够补满用户的周配额和 5 小时配额,具体执行重置的时间不由官方统一安排。据智谱官方运营说明,用户无需在发放后立即使用,可自行选择何时触发重置。重置券可在「控制台 - 用量统计」页面查收,并须在有效期内使用。
读原文 →
Ollama 订阅方案改按 token 计费
开发生态
Ollama 的订阅方案现按 token 核算云端模型用量,各模型均按每 100 万 token 列出输入、缓存输入和输出费率。Free、Pro、Max、Team 的并发请求上限依次为 1、3、10、10。
Ollama 现已启用按模型费率和 token 数量计算云端用量的订阅计费机制,定价表分别标注每 100 万 token 的输入、缓存输入和输出价格。据其说明,Pro、Max 和 Team 每月包含固定美元金额的用量额度,Free 则为较少的入门模型提供起始用量。所有方案都能添加额外额度,系统会先扣除方案内额度,再使用额外余额;添加后可使用全部模型。内含额度不结转,付费方案每月在订阅开始日对应的日期刷新,Free 在注册日对应的日期刷新。切换方案后,新方案的完整月度额度立即可用,重置日期仍按原订阅开始日计算。在自有硬件上运行模型始终不限量。
Team 方案月费 500 美元起,不限用户数,每月包含全团队共享的 1,000 美元用量额度。超出部分从团队共享余额中按量扣费,用户可以向余额添加固定金额并关闭自动用量计费。Ollama 会为加入者创建独立的团队账户,同一登录信息可用于切换个人账户和团队账户。并发请求上限为 Free 1 个、Pro 3 个、Max 和 Team 各 10 个;超出上限的请求会进入队列,队列达到固定容量后,新请求将被拒绝,直至并发槽位空出。付费方案使用量达到月度内含额度的 90% 时,Ollama 会发送电子邮件提醒,用户可在设置中关闭。
读原文 →
World Labs 发布世界模型 Atlas,统一架构覆盖生成、重建与时空模拟
模型发布
World Labs 发布下一代世界模型 Atlas,以统一架构原生处理 text、images、video 和 3D,并覆盖生成、重建与模拟;官方案例用少量参考图生成了 1 分钟、1440p 视频。
World Labs 推出从零开始预训练的下一代世界模型 Atlas,并计划将其用于 Marble 的未来版本及公司的其他产品。Atlas 采用 multimodal autoregressive diffusion transformer,将不同输入整合为共享的 spatial context,再据此生成后续画面;每张图像均绑定 3D 空间位置,精确的 camera geometry 也可直接作为输入。官方展示的流程可使用 1 至 6 张图像配合手工设计的相机路径,从任意机位和角度补出新视角;其中一个案例以少量参考图生成了 1 分钟、1440p 的视频。
在重建任务中,Atlas 可接收数量不定的场景图像,并依据模型知识补全输入中不可见的区域;随着输入增加,需要模型推断的内容会减少。据官方说明,Atlas 通常仅凭 2 至 3 张图像即可进行忠实重建,效果超过只针对 3D reconstruction 训练的 state-of-the-art 模型,同时其 spatial context 也能容纳超过 100 张输入图像。演示依次加入花园、相邻小屋和主屋的 3 张照片后,输出逐步减少了推断内容;另一案例使用 2 至 25 张地面照片构建 Stanford Main Quad,并生成高于校园的航拍路径。同一组少量输入还可生成多条速度、长度或复杂度不同的相机轨迹,同时保持场景一致。
读原文 →
Meta 发布实时音频感知模型 Muse Voice Transcribe
模型发布
Meta 发布 Muse Voice Transcribe,这是其首个实时音频感知模型,可处理 25 种以上语言、区分 20 名以上说话者,并支持流式 ASR 和句内 code-switching。
Meta 已推出由 Meta Superintelligence Labs 开发的 Muse Voice Transcribe,模型可实时完成 streaming ASR、diarization 和 endpointing。它原生支持 25 种以上语言,可识别句内 code-switching,并利用语言、关键词和上下文 biasing 提高识别准确率;diarization 支持 20 名以上说话者,官方演示还展示了同一房间内 8 人交谈的实时转录和说话者区分。官方表示,截至 2026 年 9 月 1 日,该模型在 Artificial Analysis 的 streaming speech-to-text 排名和公开 diarization benchmarks 中均列第一。其在线 demo 使用麦克风生成转录,音频只用于处理且不会存储,AI 生成的文本可能存在错误。
读原文 →
讯飞星火开源星火X2.5端侧模型
模型发布
科大讯飞词元星火已发布并开源星火X2.5-4B与星火X2.5-1.7B两款端侧通用大模型,官方称该系列原生支持最长100万Token上下文,相关API已在讯飞星辰MaaS平台限时免费开放。
科大讯飞词元星火现已开放星火X2.5-4B和星火X2.5-1.7B的模型权重、代码仓库与部署文档,相关内容可从Hugging Face、GitHub等平台获取,对应API也已上线讯飞星辰MaaS平台并限时免费。官方表示,两款模型采用混合注意力架构,面向Agent、代码、数学和指令遵循能力进行优化;该系列原生支持最长100万Token上下文,是端侧模型中的首个此类模型。据其说明,星火X2.5-4B在SWE-Bench Pro、AIME 2026等多项测试中取得同尺寸领先成绩;两款模型均在全国产算力平台完成训练,支持英伟达、华为、海光、后摩硬件,兼容vLLM、SGLang、llama.cpp,可通过Ollama、LM Studio部署,采用Apache 2.0许可证。
读原文 →
Celeris 推出混合扩散模型 Celeris-1 Magnus
模型发布
Celeris 现已向全部 API 客户开放混合扩散模型 Celeris-1 Magnus。官方称其在 τ³-Banking 中完成 97 项任务中的 40 项,中位对话耗时为 57 秒。
Celeris 已在 inference.celeris.ai/celeris-1-magnus/v1 上线其第二款模型 Celeris-1 Magnus,面向所有 API 客户提供;该模型采用更大的混合扩散架构,原生支持 reasoning,用于多步 tool use、需要实际运行的代码,以及必须自行检索信息的任务。官方在 τ³-Banking 基准中使用同一套 harness、tools 和 customer simulator,对比 Magnus、OpenAI gpt-5.6-sol、gpt-5.6-luna 与 Google gemini-3.7-flash;前三者采用相同的 low reasoning 设置,gemini-3.7-flash 使用 API 默认设置。该基准模拟银行客服对话,政策存放在需通过 retrieval tools 访问的知识库中,只有找出并执行任务要求的准确 action sequence 才计分。
据其说明,Magnus 完成 97 项任务中的 40 项,中位完整对话耗时为 57 秒。gpt-5.6-sol 耗时 79 秒,少完成 3 项,单项任务耗时接近多 30%,其 API 账单约为 Magnus 的 10 倍;gemini-3.7-flash 耗时 1 分 30 秒,少完成 9 项。Magnus 沿用 celeris-1 的 OpenAI-compatible spec,切换模型只需修改一行;reasoning_effort 默认开启,可设为 none 以获得 celeris-1 式直接回答,也可设为 low 以使用此次基准中的 Agent 配置。官方表示 celeris-1 将继续提供。
读原文 →
Abliteration.ai 发布 GLM-5.3 abliterated 版模型
模型发布
Abliteration.ai 发布基于 GLM-5.3 的 abliterated-model-large-v2,并已通过 API 上线。官方称该模型移除了导致拒绝的权重方向,保留编码、网络安全和 Agentic 能力。
基于 GLM-5.3 构建的 abliterated-model-large-v2 现已由 Abliteration.ai 推出,并以 API 形式提供服务。据其说明,abliteration 的处理方式是先定位模型激活中导致拒绝的方向,再将这些方向从权重中移除。官方表示,经过该处理后,模型仍保有编码、网络安全和 Agentic 能力,并且不会在任务链执行到一半时拒绝继续完成任务。
读原文 →
腾讯混元发布 Hy4 preview 轻量版(量化版)
模型发布
腾讯混元把旗舰模型 Hy4 preview 约 1.5TB 的权重压缩至约 214GB,压缩幅度约 86%。对应的 3 个 GGUF 量化版本已发布到 Hugging Face 的 AngelSlim 仓库。
Hy4 preview 的轻量量化版已由腾讯混元推出,采用 Sherry 稀疏三值量化算法和 MIX-STQ1_0 混合精度策略,将模型权重从约 1.5TB 减至约 214GB。据腾讯混元的测试结果,该版本在长文理解、多轮长上下文检索方面与 BF16 原版基本处于同一水平,数学评测有所回落,在多个主流评测集上与原版的差距在一两分以内,整体领先社区常用的 UD-IQ1_M 量化方案。Hugging Face 的 AngelSlim 仓库已提供 3 个量化 GGUF 版本,其中 STQ1_0 版为 213.66 GiB,全量驻留显存约需 214GB。仓库说明,这些文件不能直接在原版 llama.cpp 上运行,须先应用仓库提供的补丁。
读原文 →
Google 推出图像创作与编辑工具 Google Pics
产品应用
Google 开始推出 AI 图像工具 Google Pics,覆盖全部 Google AI Pro、Ultra 订阅者及多数 Workspace 企业客户。Docs、Slides 集成已启动,Drive 将在未来数周跟进。
Google 已启动 Google Pics 的分批发布,全部 Google AI Pro、Ultra 订阅者和多数 Workspace 企业客户将在未来数周内陆续获得使用权限;Docs 与 Slides 集成从发布时开始,Drive 集成将在未来数周推出。Google Pics 可通过 pics.new 作为独立产品使用,也会嵌入 Workspace。据其说明,该工具基于 Nano Banana 图像生成与编辑模型,支持生成图像、修改现有素材,以及多人共同编辑同一图像,可用于制作海报、社交媒体内容、数字公告、数字插画、产品 mockup 和品牌概念。用户还可将 Google Drive 文件直接放入 Pics。Google 表示,Workspace 产品每月有数百万用户与数十亿张图像交互,相关集成可减少复制、粘贴和切换标签页。
读原文 →
OpenAI 上线 ChatGPT 礼品卡:仅限美国美元账户网页端兑换
产品应用
OpenAI 公布了 ChatGPT 礼品卡规则:据其说明,美元数字卡目前由部分授权零售商销售,仅限美国地区的美元账户在网页端兑换;余额可支付订阅、续费、升级和额度购买。
OpenAI 已在官方帮助中心公布 ChatGPT 礼品卡的购买与兑换规则,并表示目前可从部分授权零售商购买数字版,兑换和使用仅限美国地区、以美元结算的 ChatGPT 账户,其中兑换须在网页端完成。据其说明,该礼品卡是以美元计价、不可充值的储值卡,兑换还受账户余额和每日充值上限约束。兑换后的余额可用于 ChatGPT 订阅、续费、升级和额度购买,但不能支付 Apple App Store 或 Google Play 的交易。可兑换的账户包括 ChatGPT Free、Go、Plus、Pro,以及 ChatGPT Business 工作区所有者。
读原文 →
Manus 宣布正式恢复独立运营,创始团队继续领导公司
行业动态
Manus 宣布恢复独立运营,并由创始团队继续领导,后续仍将面向全球用户推进通用 AI Agent。过渡期间已备份但尚未恢复数据的用户可使用恢复门户,官方表示该操作没有截止期限。
Manus 已正式恢复独立运营,创始团队将继续领导公司,该安排已通过其官方博客和官方账号公布。公司表示将继续投入产品创新,并以独立 agent lab 的形式面向全球用户推进通用 AI Agent。据其说明,后续产品方向包括更深入地进入用户日常工作流程、更直接地与世界交互,以及更主动地代表用户采取行动。此前的过渡期间,部分用户需要备份和恢复数据,并经历了访问的临时中断。已经完成备份但尚未恢复数据的用户可通过恢复门户处理;官方表示恢复没有截止期限,未受影响的用户无需采取任何操作。
读原文 →
Anthropic 推出 Enterprise Frontier Safeguards
行业动态
Anthropic 发布 Enterprise Frontier Safeguards,将 ZDR 与跨会话滥用监测结合,活动数据保存在客户自有云环境。该方案将于秋季晚些时候分阶段推出,并计划支持 7 个 Claude 及合作云平台入口。
Anthropic 宣布 Enterprise Frontier Safeguards(EFS)将从秋季晚些时候起分阶段向客户开放;该方案在提供 zero data retention(ZDR)的同时,把监测所需活动数据保存在客户控制的云基础设施中,而不是 Anthropic 的环境中。在 EFS 就绪前,符合条件的客户将在 Fable 5 和 Fable 5.1 上获得 ZDR。官方表示,EFS 由其与金融服务、医疗、制造、电信、法律、零售和公共部门的 100 多家客户,以及 Amazon Web Services、Google Cloud 和 Microsoft Azure 共同开发。支持范围包括 Claude Code、Claude Enterprise、Claude Platform、Amazon Bedrock、Claude Platform on AWS、Google’s Agent Platform 和 Microsoft Foundry。
据其说明,复杂滥用可能横跨多个任务、会话和账户,逐次分析后立即删除数据无法完成关联检测,因此 Anthropic 自 Fable 5 起实施 30 天数据保留;该公司称,未经明确许可,从未也不会使用企业数据训练。EFS 允许客户在自有云账户中依照自己的加密密钥、访问策略和审计日志管理活动数据,存储可选 Amazon S3、Azure Blob Storage 或 Google Cloud Storage。自动系统分析滚动流量窗口,识别开发进攻性网络或生物能力的尝试,以及凭证被盗或泄漏迹象,再将标记直接发送给客户,不要求 Anthropic 员工人工审查。无论客户直接使用 Claude,还是通过 3 家云合作伙伴接入,官方称控制能力相同,数据均保存在客户自己的云账户。
读原文 →
消息称 Anthropic 与 Lambda 签署 350 亿美元云计算协议
行业动态
据知情人士于 2026 年 8 月 31 日透露,Anthropic 已与获 NVIDIA 投资的云服务商 Lambda 签署 350 亿美元云计算协议,涉及得克萨斯州一座容量约 350 兆瓦的数据中心。
据知情人士于 2026 年 8 月 31 日透露,Anthropic 已与获 NVIDIA 投资的云服务商 Lambda 签署一项价值 350 亿美元的云计算协议,用于快速扩充 AI 算力。该人士称,协议对应的数据中心位于得克萨斯州努埃塞斯县,由 Hut 8 开发,容量约 350 兆瓦。报道还称,Lambda 将在该设施部署 NVIDIA 芯片,并以此向 Anthropic 提供云服务,以应对 Claude 需求增长。
读原文 →