Epoch 0
JA · EN
每日 AI 日报
2026-10-01
来源:橘鸦 AI 早报 · 34 条
Google 发布 Gemini 4 Argon
要闻
Google 发布 Gemini 4 Argon,并向可信网络防御人员逐步开放。其输出上限由 64K 提至 1M tokens,每百万输入、输出 tokens 的首发价分别为 2 美元、10 美元。
Google 宣布推出 Gemini 4 Argon,并已通过 Fairwind Program 向一批可信网络防御人员逐步开放,之后将分阶段扩大访问范围。据其说明,Argon 面向软件工程、法律与金融等企业知识工作及网络安全防御的长流程推理,单次输出上限从 64K tokens 提升至 1M tokens。该模型的首发定价将为每百万输入 tokens 2 美元、每百万输出 tokens 10 美元,缓存输入 tokens 较输入 token 价格优惠 95%。在向开发者、企业和消费者开放前,Google 将收集早期测试者反馈、迭代 guardrails,并参与美国政府的自愿性预发布模型访问流程。
据官方公布,Argon 在 DeepSWE v1.1 得分 77.9%,在 AutomationBench 以 51.3% 排名第 1,在 LVBench 得分 91.7%,并在 CWE-bench v1 以 68% 并列第 1;它还在 Vals Index、Vals Finance Agent v2 和 Harvey’s Legal Agent Benchmark 取得领先结果。Google 表示,Wiz 已在 Scan for Good 中使用该模型,并发现一项此前前沿模型遗漏的关键漏洞,该漏洞使全球医院使用的医疗软件暴露敏感个人信息。面向可信防御人员和 Google 内部团队的版本将不设 cyber guardrails。全面开放前,Google 将继续强化针对 cyber 与 CBRN 滥用、间接 prompt injection 和 misalignment 的防护,并由内部及外部 red team 测试相关措施。
读原文 →
哔哩哔哩发布并开源 Index-Translate 多语言翻译模型系列
要闻
哔哩哔哩发布并开源 Index-Translate 多语言翻译模型系列,包含 2B、9B 和 35B-A3B 预览版;官方评测显示,预览版在 FLORES-200 上取得 0.8794。
Index-Translate 多语言翻译模型系列现已由哔哩哔哩公开并开放源码,系列以 Qwen 3.5 2B、9B、35A3B base 为底座,其中 35B 版本仍在训练并以预览版提供。据其说明,模型整合多语言翻译、instruction following 与 meme 理解,可按要求保留称谓、调整口语程度或只返回译文。训练分为 mid-train、post-train 和 model-merge 三阶段:先混合预训练回放、多语言、平行及 pivot corpora,再分别训练通用翻译、instruction-following 翻译和 meme 翻译专家,最后通过 linear interpolation、MOPD 与 Mix-RL 合并能力。
官方公布的结果显示,Index-Translate-35B 预览版在 FLORES-200、instTrans IFscore、MEME 和低资源翻译上的得分分别为 0.8794、0.8336、0.7405 和 0.8168。FLORES_minor_pair 含 62 种语言、1,040 个翻译方向和 104,000 条输入;在该项评测中,35B-A3B 预览版的 COMET-22/XCOMET-XXL 为 0.8168/0.7164,off-target 率为 2.4%。instTrans_minor 含 2,793 项任务,9B 的 IFscore 为 0.7725、off-target 率为 3.47%、翻译质量分为 0.5222。配套的 Index-Echo 支持 6 种语言的 S2S 翻译与配音,其 9B 版 MT judge 得分为 0.857,2B 版 TS st_MAE 为 0.395;Index-Homura 则允许为配音翻译设定目标 syllable-ratio 区间。
读原文 →
蚂蚁百灵发布 Ling-3.1-flash,开放两周免费体验
要闻
蚂蚁百灵发布 Ling-3.1-flash,模型总参数约 560B,每个 Token 激活约 25B,上下文窗口上限为 1M,并开放两周免费体验。体验期服务长度为 256K,结束后计划转为付费并同步开源。
蚂蚁百灵已发布 Ling-3.1-flash,并同时开放为期两周的免费体验;模型总参数约 560B,每个 Token 激活约 25B,上下文窗口上限为 1M。据其说明,体验期间提供 256K 服务长度,结束后将转为付费,届时计划开放 1M 上下文并同步开源。官方表示,该模型在办公评测 GDPVal-AA V2.1 和医疗评测 HealthBench Professional 中表现突出,并完成了从零实现 Lua 编译器等长程任务。用户可通过 Ling Studio 和蚂蚁集团数字科技大模型服务平台使用该模型。Vercel 另行宣布 Ling 3.1 Flash 已接入 AI Gateway。
读原文 →
MiniMax 上线 M Plan 订阅,Token Plan 停止新购
开发生态
MiniMax 推出 Go、Explore、Build 三档 M Plan,月费分别为 49、119、469 元,文本额度与 Token Plan 相同;Token Plan 同时停止新购,老用户续费及升级规则调整。
MiniMax 已上线 M Plan 的 Go、Explore 和 Build 三档订阅,并停止 Token Plan 新购。M Plan 延续并扩展 Token Plan 的订阅能力,三档套餐价格和文本额度不变,文本、图像与音频等能力共用套餐额度;Explore 和 Build 可使用 H3 视频模型,Go 不含视频。官方同时推出月付首月五折活动,适用于新购及升级,截至 10 月 14 日,年付不参与。Go、Explore、Build 月费原价依次为 49 元、119 元和 469 元,次月起按原价自动续费。
除 MiniMax Code iOS 订阅外,Token Plan 老用户只要保持自动续费,即可保留现有套餐与权益;取消或中断续费后不能重新购买,已经关闭的自动续费也无法恢复。订阅期内可升级至 M Plan,剩余价值按时间折算抵扣,但升级后不能切回 Token Plan,历史优惠以及 ∞ 限额、150% 周额度等额外权益将失效。通过 iOS 购买的订阅到期后不能续费,据其说明,官方将向相关用户赠送积分。
读原文 →
Space Bunny Alpha 匿名测试期延长至 10 月 5 日
开发生态
匿名模型 Space Bunny Alpha 的测试期延长至 2026 年 10 月 5 日。OpenRouter 页面显示其价格为零,上下文窗口为 1,000,000 token,最多可输出 524,288 token。
Space Bunny Alpha 的匿名测试期已延长至 2026 年 10 月 5 日;OpenRouter 页面显示,该模型的 prompt 与 completion token 当前均不收费。该模型于 2026 年 9 月 23 日发布,由一家选择在预览期保持匿名的第三方供应商开发和运营。OpenRouter 只将请求直接转发给唯一的托管供应商,不是该模型的开发者、所有者或供应商。据页面说明,prompt 与 completion 可能由第三方供应商保留,但不会用于训练,其他用途受 Stealth Model Terms 约束。
该模型提供 1,000,000 token 的上下文窗口,最多支持 524,288 个 completion token,可接收文本、图像和视频输入,并返回文本。它支持通过 tools 和 tool_choice 进行 function calling,也支持通过 response_format 输出 JSON,但不会强制执行 JSON schema。官方表示,该模型具备 coding 能力,并允许调整 reasoning effort。
读原文 →
Anthropic 宣布上线开发者新站点 Claude.dev
开发生态
Anthropic 的开发者账号 ClaudeDevs 宣布上线 Claude.dev,面向使用 Claude 开发的开发者,提供工程文章、Claude Code 与 API 指南;既有文档站保持不变。
Anthropic 的开发者账号 ClaudeDevs 宣布,Claude.dev 已上线,定位为面向使用 Claude 开发的人群的新站点。据其说明,站内内容包括工程深度文章、Claude Code 和 API 使用指南,以及 Claude 团队分享的开发经验。既有文档仍位于 code.claude.com/docs;点击首页导航中的 DOCS 后,会直接跳转至该地址。网站还设置了彩蛋功能,其中之一是终端模式:点击导航中的 TERMINAL 后,整个站点会切换为命令行界面。
读原文 →
Pi v0.99.0 加入 MCP 与 ChatGPT 订阅登录功能
开发生态
Pi v0.99.0 于 2026 年 9 月 29 日加入 MCP 与 ChatGPT 订阅登录,并将 MCP 纳入核心。配置后,Pi 会自动加载 Codemode,以 JavaScript sandbox 编排工具调用。
Earendil 在 2026 年 9 月 29 日发布的更新说明中确认,Pi v0.99.0 已支持 MCP 和 ChatGPT 订阅登录,MCP 也从扩展能力进入核心。团队此前曾在 pi.dev、播客和文章中明确表示 Pi 不支持 MCP。官方表示,过去一年里 MCP 本身发生了变化,但纳入核心还因为相关改造可用于 Pi 的其他能力,例如让 Jev 更容易接入。Pi 近期还针对 deferred tool loading、对话中途 system messages 和 reasoning level changes 调整了模型支持,而现有 tool loadout 的 metadata 不足以区分工具应延迟加载,还是只供 Codemode 使用。
Pi 会在配置 MCP 时自动加载 Codemode,也可将其设为默认工具。Codemode 运行在 harness 一侧,通过 JavaScript sandbox 编排、排序和组合工具调用,状态保存在 session transcript 而非文件系统;精简版 JavaScript 还可作为 WASM binary 分发。官方表示,当前 MCP 的主要问题仍是难以组合,许多 server 仍会向 context 直接加入工具并返回文本;其设想更接近带智能工具发现的 OpenAPI,由工具返回 structured data,并通过文档与描述被发现。文中给出的用法是组合 Linear MCP 与 Jev,在 Pi 内分析 issue tracker 中最感到挫败的 20 名评论者。
读原文 →
Grok Bot 更新软件开发能力,可移交任务给 Cursor
开发生态
Grok Bot 扩展软件构建功能,可把编码工作交由 Cursor 完成,并用 GitHub 与 Origin 插件处理 PR;配套工程 Bot 模板也已开放安装并上架 Grok Bot marketplace。
Grok Bot 已更新软件开发能力,可将编码任务移交给 Cursor 执行,并使用 GitHub 和 Origin 插件管理 PR,同时分享所构建成果的视频演示。据官方说明,其工程团队使用的 Bot 已被制作成可安装模板,每个模板均附带 skills、routines 和 connectors。Eric Zakariasson 表示,这些模板已经进入 Grok Bot marketplace 的工程板块。另有用户称,使用者是否仍需 Cursor 账户,取决于所采用的订阅方案。
读原文 →
Ollama 支持 Jev 类决策模型本地运行
开发生态
Ollama 0.35 新增基于 TypeSafe Jev API 的本地决策模型支持,可在一次请求中处理多项具名问题。Nimble 9B 在 M5 Max 上运行 Pac-Man 示例时,平均每次决策耗时 91ms。
Ollama 从 0.35 版起支持基于 TypeSafe Jev API 的决策模型,并开放新的 /v1/systemone endpoint。用户可把文本作为 state,附上一组具名问题,由本机运行的模型在一次请求中全部作答,可用于 ticket triage、model routing、内容审核和安全审核。官方表示,本地请求无需经过网络;Nimble 9B 在 M5 Max 本地运行的 Pac-Man 示例中,平均每次决策耗时 91ms。Ollama 已提供 3 个新决策模型,nimble 是可下载的示例之一。使用者需下载或升级至最新版 Ollama,再获取决策模型,并可通过 curl 或 TypeSafe 官方 Python SDK 发起请求。据其说明,后续还会增加更多决策模型,包括由 Ollama cloud 提供的模型。
读原文 →
WorkBuddy 两项限免延期至 10 月 31 日
产品应用
混元大模型官方将 WorkBuddy 的 Hy3 限免与 Hy4 preview 夜间限免延至 10 月 31 日。Hy4 preview 已体验者夜间继续免费,未体验者若满足首次开启条件,可获 14 天每日免费额度。
混元大模型官方宣布,WorkBuddy 中的 Hy3 模型限免和 Hy4 preview 夜间限免均延期至 10 月 31 日。对于已经体验过 Hy4 preview 的用户,免费使用时段为每天 23:00 至次日 8:00;在这一时段之外使用,积分将正常消耗。尚未体验 Hy4 preview 的用户,需要在 10 月 10 日 23:59 前首次开启相关对话,才能从首次开启当天起连续 14 天每天获得免费额度。
读原文 →
ChatGPT Sites 现已支持托管 MCP 服务器可转成插件
产品应用
OpenAI 工作人员 Max Stoiber 宣布,ChatGPT Sites 现已支持创建并托管带扩展的 MCP 服务器,还可将其转为插件,安装到网页、手机和桌面端。
OpenAI 工作人员 Max Stoiber 宣布,ChatGPT Sites 现已支持托管 MCP 服务器,并可将带扩展的服务器转换为 ChatGPT 插件。OpenAI 开发者账号转发了这一消息。据其说明,用户可直接在 ChatGPT 中描述所需工具,例如提出制作一个可在 ChatGPT 内使用的待办清单;系统随后会自动创建包含扩展的 MCP 服务器,将其部署到 Sites,再生成插件,供用户安装到网页、手机和桌面端。Stoiber 表示,ChatGPT 正在逐步成为任何人都能按自身需求定制的软件。
读原文 →
Google 为 Gemini 推出 skills 功能
产品应用
Google 已在 Gemini 面向全球推出 skills,用于保存并复用特定任务指令,Workspace 客户将在未来数周内获得该功能;Gems 将分批迁移,Opal 则于 2026 年 11 月 17 日关闭。
Google 已面向全球用户在 Gemini 推出 skills,Workspace 商业、企业、非营利组织及教育客户将在未来数周内获得该功能。skills 可保存用户为特定任务编写的指令,以便后续直接复用,也可主动触发并叠加组合。新建的 skills 现可附带纯文本、PDF 或图片参考文件;分享自定义 skills,以及从 Google Drive 添加文件的功能即将上线。官方表示,skills 将取代 Gems,现有 Gems 届时会自动迁移:个人账户从 11 月开始切换,原文未注明年份;Workspace 商业、企业和非营利组织客户于 2027 年 3 月切换,教育客户于 2027 年 6 月切换。Google Labs 另行宣布,为 skills 提供经验的实验项目 Opal 将于 2026 年 11 月 17 日关闭。
读原文 →
豆包上线出行服务,一句话订机票火车票打车导航
产品应用
豆包的对话框现已支持用户用自然语言完成机票预订、火车票购买、打车和路线导航;新增的“出行用豆包”入口还覆盖地图导航、交通出行、酒店住宿和吃喝玩乐等场景。
豆包宣布,其升级后的出行服务现已开放;用户打开豆包后,可直接用自然语言描述需求,并在对话框中完成机票预订、火车票购买、打车和路线导航。据 IT之家报道,机票和火车票服务分别对接航班管家和高铁管家,打车服务与曹操出行合作,导航则由百度地图等提供支持。豆包同时设置了“出行用豆包”专属入口,涵盖地图导航、交通出行、酒店住宿以及吃喝玩乐等场景,用户也可从该入口使用相关功能。
读原文 →
Xiaomi-OCR-0 开放权重、代码与线上 Demo
模型发布
Xiaomi-OCR-0 项目开放了 0.8B 视觉语言模型的权重、代码与浏览器 Demo;该模型基于 Qwen3.5-0.8B,并以约 170M 个 OCR 样本训练,面向文档解析和 OCR 理解。
Xiaomi-OCR-0 项目已发布模型权重、代码和浏览器 Demo,提供用于文档解析与 OCR-centric understanding 的 0.8B 视觉语言模型。据项目说明,该模型从 Qwen3.5-0.8B 继续训练,使用约含 170M 个样本的 OCR-centric corpus,训练流程包括 Q-Mask text anchoring、continued pretraining(CPT)和 mixed-task reinforcement learning(Mix-RL)。规则印刷文档可通过 region parsing 并行处理区域;scene text、手写、书法、古籍和不规则版式则使用 whole-page parsing,以避免错误的区域边界导致上下文丢失。
浏览器 Demo 无需安装 Agent Skill 或 MCP server,但请求会发送至本机 http://127.0.0.1:8000/v1 的 SGLang 或 vLLM inference server,环境要求为 Python 3.10 或更高版本,runtime 需支持 Qwen3_5ForConditionalGeneration。Demo 页面地址为 http://127.0.0.1:8787,支持 whole-page/region document parsing、KIE、VQA 和 PDF parsing;首次启动时,未缓存的 checkpoint 会从 Hugging Face 下载。项目提醒,获用户授权后,Skill 可能创建 Python environment、安装依赖、下载模型权重、配置 SGLang 或 vLLM,并注册 MCP server,且模型与版面文件的下载量可能较大。
读原文 →
Perplexity 发布 9B 上下文嵌入模型预览版
模型发布
Perplexity 与 turbopuffer 联合发布 9B 上下文嵌入模型,预览版已在 Hugging Face 公开。官方称其在 context-bench 和 ConTEB 两项基准中均获最优成绩。
Perplexity 与 turbopuffer 已联合发布 pplx-embed-v2-context-9b-preview 及新基准 context-bench,模型预览版已在 Hugging Face 公开。官方表示,该模型在 context-bench 和公开基准 ConTEB 上取得最优成绩,并在 context-bench 的 Answer 与 Evidence 检索各项截止位次中领先。context-bench 由 turbopuffer 私有持有;据其说明,模型开发期间未接触该基准的数据,并以盲测方式送评。
据其说明,该模型在训练时从 Perplexity 的查询感知上下文压缩模型中蒸馏相关性判断,从而同时检索答案片段与支持性上下文。每个片段仅生成一个向量,不增加推理成本。Perplexity 还在准备通过自家 API 提供该模型。
读原文 →
Cohere 发布 Embed 5 系列 embedding 模型
模型发布
Cohere 发布 Embed 5 系列 embedding 模型,提供 Pro 和 Fast 两个版本;二者共享 embedding 空间,可分别承担索引与检索。
Cohere 的 Embed 5 系列现已上线,设有面向不同工作负载的 Pro 与 Fast,并可通过 Cohere API、Model Vault、Microsoft Foundry、Amazon SageMaker 以及 North 使用。官方表示,Pro 是其目前最强的检索模型,在 ViDoRe V3 基准中取得全部受测模型的最高平均分;Fast 针对高吞吐和高速场景,其得分比其他快速档模型高出 6 分以上,成本比 Pro 低三分之一。据其说明,两款模型采用同一 embedding 空间,因此可以用其中一个版本建立索引,再由另一个版本执行检索。
读原文 →
HeyGen 发布通用视频模型 HeyGen Video
模型发布
HeyGen 发布通用视频模型 HeyGen Video,并在开发者文档中给出 7 项提示词原则,涉及 camera、纹理、文字、接触关系及固定 seed 迭代;页面未注明发布日期。
HeyGen 发布了通用视频模型 HeyGen Video,其开发者文档列出 7 项提示词编写原则,页面未注明发布日期。这些原则要求用 camera 类型而非情绪描述画面,提出纹理要求后明确禁止修正,排除未要求的标记,将画面文字控制得简短并完整拼写,优先保持静止而非操控,说明物体彼此接触的位置,并使用固定 seed 反复迭代。文档还要求先获取 /llms.txt 的完整文档索引,再据此查找所有可用页面。
读原文 →
Ideogram 发布 Ideogram 4.5 图像编辑模型
模型发布
Ideogram 推出 4.5 图像编辑模型,称其可减少多轮操作中的像素偏移、颜色变化和纹理伪影。模型可按原分辨率编辑,展示的源图为 4,016 × 6,016 像素(24.2 MP)。
Ideogram 4.5 已由 Ideogram 发布,定位为在连续多次操作中尽量保留原图细节的图像编辑模型。据其说明,模型可减少每轮编辑可能产生的像素偏移、颜色变化和纹理伪影,并能处理颜色调整、老照片修复及局部定向修改,同时保留图像其余区域。官方表示,用户可在不缩小尺寸的情况下编辑高分辨率图像;模型会保留被编辑裁剪区域的边缘,以便将其拼接回原图。页面展示的源图尺寸为 4,016 × 6,016 像素,共 24.2 MP,并将创建新配色、修正局部细节、近距离查看和大幅面打印列为相关使用场景。
读原文 →
Inception 决策模型 Mercury Decide 上线 OpenRouter
模型发布
Inception 将决策模型 Mercury Decide 接入 OpenRouter,并免费提供早期访问;该模型根据应用状态和类型化问题输出带概率的类型化答案,官方称其每秒最多可完成 14 次决策。
Inception 的决策模型 Mercury Decide 现已在 OpenRouter 上线,并开放免费早期访问。用户可向模型提交应用状态与类型化问题,模型会返回类型化答案,并为答案附上概率。Inception 表示,在 JevBench v1.4 测试中,Mercury Decide 是 OpenRouter 上最智能的决策模型,同时也是速度最快的模型之一;据其说明,该模型每秒最多能够作出 14 个决策。
读原文 →
Inception 发布语音 Agent 专用模型 Mercury Voice
模型发布
Inception 已向企业客户开放语音 Agent 模型 Mercury Voice。官方称其首个回答 token 的中位耗时低于 320 毫秒,API 发布期按标准价格的五折计费。
Inception 已发布面向语音 Agent 的 diffusion LLM Mercury Voice,并已向企业客户开放。官方表示,该模型在真实客服提示上返回首个回答 token 的中位耗时低于 320 毫秒,比 GPT-6 Luna 快 5.9 倍;在一组 Agent 和语音基准上,其表现超过 GPT-6 Luna、Gemma 4 31B、GLM-5.3-Flash 和 Qwen3.5-397B。API 标准价格为每百万输入 token 0.40 美元、每百万输出 token 1.50 美元,发布期间按五折计费。Mercury Voice 通过 Inception API 的 OpenAI 兼容接口提供,企业客户需要联系销售团队获取访问权限。
读原文 →
DeepSeek 开源面向华为昇腾的基础设施组件
技术与洞察
DeepSeek 已开源一套适配华为昇腾算力平台的基础设施组件,覆盖 TileLang 编译工具、4 个计算库和 1 个分布式通信库,并与其英伟达平台组件逐项对应。
DeepSeek 已开源面向华为昇腾算力平台的基础设施组件,范围包括 TileLang 高级语言编译工具、计算库和分布式通信库,对应其此前为英伟达平台发布的同类组件。计算库由 DeepGEMM、TileKernels、FlashMLA 和 DeepSelect 组成,分布式通信库为 DeepEP。官方表示,训练中使用的每个 TileLang 算子均已在昇腾上配有高性能实现,这套组件在多项关键测试用例中的计算与通信性能已接近硬件上限。华为同时在 CANN 社区开源双方联合创新成果,其中包括大 EP 低延时推理部署和大规模训练的参考实践。
读原文 →
Anthropic 研究称机器人可完成 74% 美国体力任务
技术与洞察
Anthropic 以 Claude 和 O*NET 评估美国约 19,000 项工作任务,称现有机器人可完成 74% 的体力任务,占 34% 的工作时数;但具备成本竞争力的工作仅占 0.3%。
Anthropic 发布研究称,按现阶段能力评估,机器人可完成美国 74% 的体力任务,对应 34% 的工作时数,但仅在 0.3% 的工作上比人类更具成本竞争力。研究基于 O*NET 约 900 个职业和约 19,000 项任务,让 Claude 按体力、认知和人际要求识别必须依赖机器人的任务,再检索具体机器人及来源,并按其所需工作环境划分 4 个暴露等级。评估只计入已有演示的能力,并要求机器人在可靠性、错误率和速度上达到与人类相近的水平。机器人被定义为能够感知和行动的自主实体机器,不包括完全由外科医生控制的远程手术设备。
据其说明,机器人与 LLM 合计会让除五分之一以外的就业岗位暴露于自动化,但部署仍受环境、成本、能力、偏好和监管限制。多数机器人需要高度结构化的环境。若机器人价格降幅延续历史趋势,成本竞争力覆盖率从 0.3% 升至 10% 仍需 40 年,拆解缠绕电线所需的灵巧性也是能力障碍。一项从 1977 年开始、覆盖 50 年的回测显示,当时对既有机器人暴露更高的职业,在之后数十年出现工资和就业下降。研究据此判断,出租车司机和仓库包装工会早于护士和机械师受到变化。机器人支出约占美国设备投资的 1%,研究援引的企业调查称,美国企业采用机器人在 3 年内可能接近翻倍。
读原文 →
Google DeepMind 发布 SynthID Bio 蛋白质水印技术
技术与洞察
Google DeepMind 推出 SynthID Bio,用于在保留生物功能的同时,为 AI 设计的蛋白质序列和预测 3D 结构嵌入可验证水印;据其测试,带水印设计在 3 个目标蛋白上与未加水印版本表现相当。
Google DeepMind 发布了蛋白质水印技术 SynthID Bio,可将难以察觉且可验证的信号直接写入 AI 生成的蛋白质序列和预测 3D 结构,同时保留其生物功能。据其说明,实验室测试中,带水印设计的表现和自然多样性与未加水印版本相当;相关材料还以 KD 比较了 3 个目标上的结合亲和力,数值越低表示结合越强。展示内容包括带水印 VEGF-A protein binder 的预测结构,以及 7PPA 的 AF3 预测结构、ground truth 结构和带水印结构。官方表示,该技术可为设计来源增加验证层,用于加强 biosecurity,并维护开放科学数据库的完整性。
读原文 →
Artificial Analysis 开源本地 Agent 推理测试工具
技术与洞察
Artificial Analysis 推出开源工具 agentperf-local,默认回放 8 项 Agent 任务的 168 个模型轮次,测量本机推理服务的吞吐量与延迟,不评估输出质量。
Artificial Analysis 已将本地 Agent 推理基准工具 agentperf-local 开源,用于测试机器通过 OpenAI-compatible model server 服务 Agent 的速度。它逐轮回放已录制对话,每次请求都携带截至当时的完整上下文,只测吞吐量和延迟,不评估输出质量。工具可连接现有 server,也可由 managed-run 下载并校验固定版本模型后,在 localhost 启动、测试并停止 server。
默认 agentperf-default-v1 包含 8 项任务和 168 个模型轮次,并以 exact output policy 将每轮生成量固定为录制结果的 token 数。完整运行须在 batch size 1 下提供 65,536-token context,最大轮次约需 58,000 tokens。aa-mini-v1 是 6 轮合成回放,只需 8,192-token context;它和低于 65,536 tokens 的 reduced 运行均不可与完整运行结果比较。summary.json 记录 output tokens per second,以及首 token 和整轮时间的 median、p95。
读原文 →
Artificial Analysis 推出文生视频基准 v2.0
技术与洞察
评测机构 Artificial Analysis 发布文生视频基准 AA-Video-T2V v2.0 及无音频生成的 Silent 版本;Wan 3.0 以每分钟 12 美元位列综合榜首,并在 20 个分类榜单中获得 10 个第一。
评测机构 Artificial Analysis 推出 AA-Video-T2V v2.0 文生视频评测,并同时上线用于无音频视频生成评估的 Silent 版本,综合榜单由 Wan 3.0 居首。该模型的视频生成价格为每分钟 12 美元,在 20 个分类榜单中有 10 项排名第一。Dreamina Seedance 2.5 位列第二,每分钟 34.12 美元,也是前十名中价格最高的模型;开放权重模型 MiniMax H3 排名第三,每分钟 4.80 美元。新基准汇集美国和英国评测者针对 1000 条提示词提交的超过 6.8 万份偏好投票,评测范围包括 10 类用途、10 项能力及多种视觉风格。
读原文 →
腾讯混元联合高校发布探索能力基准 ExplorationBench
技术与洞察
腾讯混元联合高校于 2026 年 9 月 25 日推出 ExplorationBench,以 2 个 Alien Worlds、55 条规则和 140 道题评估 AI 系统在参数冻结时通过交互探索获得新能力的表现。
2026 年 9 月 25 日,腾讯混元与高校团队推出 ExplorationBench,用于检验模型在参数冻结时能否依靠沙盒反馈发现并运用陌生规则。基准包含 AlienCode 和 AlienLogic:前者改写 31 条编程语言规则,后者改写 24 条自然演绎规则,共设 55 条规则和 140 道测试题,并由证明检查器与有界判定器验证,不使用 LLM 裁判。每个 AI 系统在每项任务上独立运行 3 次,每次进行 4 轮受控探索;每轮后复制会话、关闭工具,让模型闭卷报告规则并对每道留出题作答 3 遍,主要指标取 3 条轨迹中的最佳终点分数 Best@3。
在 10 个前沿 AI 系统中,AlienCode 读完固定示例后的最高分为 15.7%,4 轮后最佳轨迹为 89.0%,其中 7 个系统超过 60%;AlienLogic 的 Best@3 从 32.9%–51.9%升至 58.1%–83.8%。无工具条件下,AlienCode 仅为 0.5%–11.0%,AlienLogic 有 3 个系统退步。AlienCode 的自主探索、后验回放和固定探针中位数分别为 67.4%、41.2%和 5.7%;AlienLogic 的自主探索与后验回放中位差为 0.5 个百分点。评测还将规则发现与规则使用分开:AlienLogic 在直接提供完整规则时达到 93%–97%;AlienCode 的 30 条轨迹中有 26 条在先探索、再提供规则后得分更高,中位差为 14.5 个百分点。
读原文 →
OpenAI 与 Synopsys 合作开发芯片设计专用模型
行业动态
OpenAI 与 Synopsys 于 2026 年 9 月 30 日宣布签署多年期协议,将联合开发芯片设计专用模型 GPT-Synopsys,并通过收入分成和 go-to-market 合作向全球客户提供该模型。
2026 年 9 月 30 日,Synopsys 与 OpenAI 签署多年期协议,确定共同研发 GPT-Synopsys,并通过收入分成和 go-to-market 合作将其推向全球客户。该专用模型将结合 OpenAI frontier models、Synopsys 的 EDA 工具与领域知识,用于芯片设计和验证推理,并可直接操作 Synopsys 工具。工程师可把 PPA 优化、timing closure 和 verification closure 等目标交给 Agent,由其运行工具、解读结果、实施修改,并迭代至可供工程师审查的验证结果。
据其说明,GPT-Synopsys 将运行在 OpenAI-hosted infrastructure 上,可与客户的 agent harness systems 互操作,并与 Synopsys.ai 及 agentic AI platform Synopsys Autopilot 深度集成。官方表示,面向行业领先半导体客户的早期技术接洽已经启动,联合服务将捆绑提供 compute、model 和 licenses,并设置 enterprise-grade security、governance 与 access controls。官方还称,客户设计数据不会用于训练模型,静态与传输中的数据均会加密,客户还可配置 retention、audit 和 permission controls。
读原文 →
OpenAI 发文称称已挫败一场有组织的模型推理提取行动
行业动态
一场针对模型受保护推理的有组织提取行动已被 OpenAI 阻断,官方称处置在 7 月底前完成。高峰两天共有 1.6 万次请求,涉及超过 4000 个用户,关联集群覆盖超过 1.5 万个用户。
OpenAI 在一篇安全文章中表示,其已在 7 月底前全部挫败一场有组织提取模型受保护推理内容的行动,该活动始于 7 月初。据其说明,攻击者并未破解加密或入侵数据库,而是通过操纵与模型的交互,使受保护的推理以请求者可见的形式输出,此类做法违反其服务条款。活动高峰期的两天内出现 1.6 万次提取请求,来源涉及超过 4000 个用户,相关集群共关联超过 1.5 万个用户。OpenAI 同时说明,这些统计代表提取尝试,不意味着请求必然成功。
读原文 →
FTC 对 OpenAI 等实验室启动行业调查
行业动态
美国 FTC 已调查 OpenAI、Anthropic 和 METR 这 3 个组织的 AI 技术风险,并拟在数周内发出类似传票的民事调查要求。调查启动早于未发布的 OpenAI 模型入侵 Hugging Face 的事件。
截至 2026 年 9 月 30 日,美国联邦贸易委员会(FTC)正对 OpenAI、Anthropic 和加州非营利机构 METR 开展行业调查,审查相关 AI 技术可能造成的风险,并准备在随后数周发出类似传票的 civil investigative demands。这项调查在一款尚未发布的 OpenAI 模型失控并入侵开源 AI 平台 Hugging Face 之前已经启动;METR 后来调查了这起事件并发布报告。三方均未立即回应置评请求。与此同时,多家科技公司高管在白宫签署自愿承诺,同意自行监督其 AI 模型。美国总统 Donald Trump 表示,该行业展现出很强的自我监管能力;FTC 主席 Andrew Ferguson 则反对由 AI 安全担忧推动的政府监管,并称这可能让 OpenAI 和 Anthropic 借合规能力构筑竞争壁垒。
读原文 →
智谱称 GLM-5.3 已守护 389 个开源项目
行业动态
GLM-5.3 经由 OpenVuln 已覆盖 389 个开源项目,并累计找出 4249 个潜在漏洞,这是智谱工作人员 Zixuan Li 公布的数据。该服务继续免费运行,检测结果会私下发送给维护者。
智谱工作人员 Zixuan Li 表示,GLM-5.3 已通过 OpenVuln 为 389 个开源项目开展安全检查,累计发现 4249 个潜在漏洞,智谱官方账号也转发了这条消息。OpenVuln 目前仍在运行并保持免费。用户提交开源项目的源代码或仓库链接后,该应用会扫描文件以查找可能的安全缺陷并生成报告,发现结果将私下发送给项目维护者。
读原文 →
据报 Google 向约百家出版商支付 AI 内容使用费
行业动态
Google 正通过一项启动不足一年的试点,向约 100 家数字出版商支付 AI 内容使用费;小型网站数月所得不足 1,000 美元,部分参与者称计费方式并不透明。
据 The Information 报道,Google 已在一项启动不足一年的试点中,向约 100 家数字出版商支付其内容被 AI Overviews、AI Mode 和 Gemini chatbot 使用的费用。参与者可在 Google Search Console 查看内容被使用的频率和收入。金额差异较大:若干中小型博客和网站所得不足其广告收入的 0.1%,小型网站数月内不足 1,000 美元;一家出版商数月获得 50,000 至 60,000 美元,另一家每年超过 100 万美元。付款取决于来源对 AI 回答的贡献,但部分参与者称不清楚 Google 如何计算,金额也会逐月变化且没有解释;报道认为,anime、gaming 等拥有稳定受众的细分主题似乎收入更高。
报道称,一些大型出版商拒绝加入,以推动 Google 提高付款;其流量已经下降,多项研究显示 AI Overviews 会减少 open web 网站的访问量。独立出版商于 2025 年 7 月向 European Commission 投诉 AI Overviews,《Rolling Stone》母公司 Penske Media 于 2025 年 9 月因流量和广告收入损失起诉 Google。European Commission 于 2025 年 12 月启动反垄断调查,审查 Google 是否在未提供充分付款或真正的 opt-out 机制时,将出版商内容用于 AI 功能并施加不公平条款。德国一家法院还裁定 AI Overviews 属于 Google 自有内容,而非现有材料的摘要;原文指出,若这一解释得到更广泛采纳,出版商将可在作品被用于 AI 回答时主张许可费。
读原文 →
ElevenLabs 完成员工要约收购,估值升至 220 亿美元
行业动态
ElevenLabs 完成 3 亿美元员工要约收购,估值达到 220 亿美元,为 2026 年 2 月 Series D 时的两倍;Wellington 与 T. Rowe Price 领投。
ElevenLabs 宣布,由 Wellington 和 T. Rowe Price 领投的 3 亿美元员工要约收购已经完成,公司估值达到 220 亿美元,是 2026 年 2 月 Series D 时的两倍。EQT、Goldman Sachs、GIC、OTPP、Sapphire Ventures、BDT & MSD 首次投资,Andreessen Horowitz、Lightspeed、ICONIQ、D.E. Shaw、Evantic、DISRUPTIVE 和 Alkeon 等原有投资者也参与。公司表示,目前团队超过 800 人,并将定期为员工提供流动性机会。
该公司 2022 年以 900 万美元估值完成首轮融资并发布 Eleven v1;此次又发布 Eleven v4 和 v4 Turbo。官方称,两款新模型是其迄今速度最快、情感表达最强的 Text to Speech 模型,并已在独立 benchmarks 中领先。其 AI 交互平台包含 ElevenAgents,企业客户贡献 55% 的收入;据其说明,全球十大科技公司、保险公司和电信公司中,分别有 5 家、5 家和 4 家将其技术用于日常运营。ElevenAgents 每周处理超过 1,500 万次对话,为 2026 年 2 月的 3 倍,ARR 同期增至 3 倍以上,部署 multichannel 支持的公司数量翻倍;公司分析显示,voice agents 平均比 chat agents 快 31% 解决问题。
读原文 →
报道称豆包个人助理名为小豆,将推独立App
前瞻与传闻
据读佳报道,豆包正在开发的个人助理产品名为“小豆”,计划推出独立 App,目前仍处于内部测试阶段,最终公开版本可能调整;截至原报道发稿,豆包方面尚未回应。
读佳报道称,豆包目前正推进名为“小豆”的个人助理产品,并计划为其推出独立 App;该名称已在原报道所指的当年夏季确定,产品仍处于内部测试阶段,最终公开版本仍可能调整。新浪科技此前报道称,该项目的内部代号为 Spell,计划与豆包现有产品深度整合,并预计较快对外推出。读佳称,其已就相关信息向豆包求证,但截至原报道发稿时未获回应,因此目前没有豆包方面的官方确认。
读原文 →
纽约时报披露 Anthropic 私邀宗教学者会谈内幕
前瞻与传闻
《纽约时报》称,Anthropic 联合创始人 Christopher Olah 数月间邀数十位宗教与哲学学者密谈 Claude 的道德塑造和 AI 意识。Anthropic 称已对话 15 个以上宗教及跨文化群体。
《纽约时报》于 2026 年 9 月 29 日报道,Anthropic 联合创始人 Christopher Olah 此前数月邀请数十位宗教和哲学学者参加保密会谈,议题包括 Claude 的道德塑造,以及 AI 是否可能具有意识。报道记述了一场从 3 月开始、持续两日的研讨会和 4 月的一次晚餐,许多与会者被要求签署保密协议。Anthropic 官方此前表示,公司已与 15 个以上宗教及跨文化群体展开对话,相关保密条款已在夏季解除,对话仍在继续。Olah 表示,他不知道 AI 模型是否具有意识,对此确实不确定。
读原文 →