每日 AI 日报

2026-10-07

来源:橘鸦 AI 早报 · 35 条

2026-10-07
2026-10-07 2026-10-06 2026-10-05 2026-10-04 2026-10-03 2026-10-02 2026-10-01 2026-09-30 2026-09-29 2026-09-28 2026-09-27 2026-09-26

Mistral Large 4 上线,月底开放权重

要闻

Mistral Large 4 上线,月底开放权重

Mistral 已开放 Mistral Large 4 的公开预览 API,并计划于公告发布当月月底开放权重。该模型拥有 1 万亿个参数,其中活跃参数为 490 亿个,预览服务可通过 Mistral Studio 使用。

Mistral 在公告发布时推出了 Mistral Large 4 公开预览,并宣布将在公告发布当月月底开放权重,原文未注明公告日期。该模型原生支持多模态,总参数为 1 万亿个,活跃参数为 490 亿个。官方表示,模型使用位于欧洲自有数据中心的 3,800 块 NVIDIA Grace Blackwell GPUs 从零训练,Mistral Studio 上的预览 API 也运行于同一基础设施。训练数据覆盖超过 160 种语言,包括欧盟全部官方语言。开放权重前,Mistral 正与网络安全领域的机构、经审核的合作伙伴及国家主管机关开展真实场景红队测试,参与者使用的模型减少了内容审核限制,并扩展了网络安全能力。

据官方公布的评测结果,ML4 在 Artificial Analysis Cyber Index 中位列全球前五,在复现开源软件真实漏洞并修补的测试中取得 82%,在包含 40 道安全竞赛题目的 Cybench 中解决了 93% 的挑战。软件工程方面,DeepSWE v1.1、SWE-Atlas-QnA 和 Terminal-Bench 4 的得分分别为 61.7%、59.4% 和 28.3%,综合 Coding Agent Index 得分为 49.8%。在涵盖 657 项业务流程的 AutomationBench 中,模型得分为 59.9%;在评估长周期知识工作的 AA-Briefcase 中,得分为 1,393 Elo。官方表示,后续还将公布模型架构、更多基准测试及 post-training 方法的细节。

读原文 →

Google 发布 Nano Banana 2.1,图像生成与编辑全面升级

要闻

Google 发布 Nano Banana 2.1,图像生成与编辑全面升级

Google 的 Gemini Image 页面素材列出 2 条英文海报生成 Prompt,分别描述户外运动与旅行场景,并细化文字、配色和构图要求;所给内容未列出模型发布日期或性能数据。

Google 在 Gemini Image 页面素材中展示了 2 条海报生成 Prompt,所给内容未注明展示日期,也未提供 Nano Banana 2.1 的发布时间或功能升级说明。两条 Prompt 都指定英文文字,并要求文字清晰可读,但采用不同的视觉布局:户外运动海报将越野跑者的圆形照片与分行大字交叠,配以米白底色、橙黑几何元素、坐标、海拔标记和条码;旅行海报则采用 1970 年代电影风格,以钴蓝背景和奶油色边框衬托大字,让坐在露营车顶部的女性遮住部分字母,并加入冲浪板、胶片颗粒和暖色自然光。

读原文 →

谷歌开源 EmbeddingGemma 2 多模态嵌入模型

要闻

谷歌开源 EmbeddingGemma 2 多模态嵌入模型

谷歌推出拥有 7.4 亿参数的 EmbeddingGemma 2,以 Apache 2.0 许可开放文本、代码、图像、视频和音频的统一嵌入能力,面向设备端检索;官方报告其 MTEB Code 得分从 68.76 提升至 78.68。

谷歌已发布基于 Gemma 4 架构的 EmbeddingGemma 2,模型拥有 7.4 亿参数,采用允许商业使用的 Apache 2.0 许可。它将文本、代码、图像、视频和音频映射到同一个 embedding 空间,可用于以语音备忘录查找视频片段,或以文本查询检索音频录音。官方表示,该模型保持了上一代的多语言文本表现,MTEB Code 得分则从 68.76 提升至 78.68,增加 9.92 分,可用于本地代码库索引、语义代码搜索和 coding agent 检索。

据官方说明,EmbeddingGemma 2 可在本地生成 embeddings,支持完全离线的跨模态搜索与检索,并可与 Gemma 4 配合构建设备端 RAG pipeline。两者共享 text tokenizer 和 audio encoder,合并运行时可降低总内存占用。谷歌提供了 Google AI Edge Gallery 中的 Instant Media Search 和 Video Moments Finder 示例,分别用于媒体库语义检索和视频片段定位;Google AI Edge Foresight 则展示了本地文件检索与上下文推理的组合。开发者还可查阅模型卡、推理和微调指南,以及使用 LiteRT 构建搜索与 RAG 系统的文章。

读原文 →

OpenAI 公开内部前沿模型的一批数学研究成果

要闻

OpenAI 公开内部前沿模型的一批数学研究成果

OpenAI 将内部前沿模型产出的 722 份数学手稿归为 372 个成果族并公开,部分证明附有 Lean 形式化。这批成果的验证进度并不一致,官方表示,尚未形式化的成果可能存在问题。

OpenAI 已在 GitHub 仓库公开内部前沿模型产出的数学研究成果,包含按 372 个成果族整理的 722 份手稿,并附论文修订与引用协议。仓库还提供许多证明的 Lean 形式化、10 份模型推理摘要,以及尝试问题数量等统计;后续取得的形式化也将补充公开。此次发布方式参考了高等研究院数学与人工智能独立咨询小组的建议和公开推荐。据 OpenAI 说明,绝大多数成果来自同一个尚未发布的内部模型,采用固定流程取得;该模型在评测中接到约 4000 个问题,平均每个成果约耗用 3 小时 ChatGPT Pro 思考算力。官方表示,各项成果处于不同验证阶段,未形式化的成果可能存在问题。OpenAI 还计划资助研讨会等活动,以帮助理解 AI 的重大成果,并表示正在努力负责任地发布产出这些成果的模型。

读原文 →

OpenAI 免费开放 Auto-review,不占订阅额度

开发生态

OpenAI 免费开放 Auto-review,不占订阅额度

OpenAI 的 Codex 与 ChatGPT 负责人 Tibo 宣布,Auto-review 已向所有通过 ChatGPT 账号登录的用户免费开放,不占订阅用量;该功能由第二个 agent 审查主 agent 的操作。

OpenAI 负责 Codex 与 ChatGPT 的 Tibo 宣布,所有通过 ChatGPT 账号登录的用户现已可免费使用 Auto-review,且使用时不消耗订阅方案用量。开启入口为设置 → 权限 → auto-review。据其说明,该功能在长任务运行期间安排第二个 agent 检查主 agent 的全部操作,用于阻止高风险动作,以及偏离用户原始意图的操作。Tibo 表示,默认沙箱设置要求逐项批准所有操作,用户若不花时间配置具体规则,容易产生决策疲劳;他称 Auto-review 改进了这一机制,并建议以其替代 full-access 权限,认为两者之间已不再需要取舍。

读原文 →

OpenAI 向所有开发者开放 Decisions API 公测

开发生态

OpenAI 向所有开发者开放 Decisions API 公测

OpenAI 已向所有开发者开放 Decisions API 公测,供应用选择模型、工具或动作。官方称其决策速度最高可达另一调用方式的 10 倍,输入每 100 万 token 收费 0.1 美元。

OpenAI 宣布 Decisions API 进入公开测试,并向所有开发者开放,供应用在近实时条件下选择模型、工具或动作。该接口由 GPT-6 Luna 驱动,接受文本和图像输入,按每 100 万输入 token 0.1 美元计费,仅收取输入费用,不收取缓存和输出 token 费用。官方表示,相比通过 Responses API 调用 GPT-6 Luna,其决策速度最高可达 10 倍。

接口提供三类输出:Predicates 估算陈述为真的概率,Choices 从预定义选项中选择并提供置信度,Scores 按数值区间评估输入。据官方说明,用途包括将请求路由至合适的模型、工具或 Agent,为大规模输入生成标签和评分,分析图像或根据截图决定动作,以及标记高风险工具调用。

读原文 →

OpenAI 将 API 付费层级从五档精简为三档

开发生态

OpenAI 将 API 付费层级从五档精简为三档

OpenAI 宣布将 API 的五个付费用量层级整合为 Build、Launch 和 Grow 三档,最高档资格所需累计付款从 1000 美元降至 500 美元,现有付费组织将自动迁移。

OpenAI 宣布调整 API 付费用量层级,将原有五档改为 Build、Launch 和 Grow 三档,原文未说明生效日期。此次调整涉及获取更高 API 速率限制的资格门槛:最高档 Grow 要求累计 API 付款达到 500 美元,此前最高档要求为 1000 美元。官方表示,已处于付费层级的组织会迁移至对应的新层级,不需要手动操作。各档资格条件和速率限制的具体信息已发布在 OpenAI 平台的组织限制设置页。

读原文 →

Space Bunny 免费期将结束,OpenCode 赞助再免费几天

开发生态

Space Bunny 免费期将结束,OpenCode 赞助再免费几天

Space Bunny 的免费期即将结束,开源编程 Agent OpenCode 宣布出资支持该模型在自家免费档位继续提供几天。OpenCode 表示,模型仍在调优,正式亮相前还会继续调整。

开源编程 Agent OpenCode 在 X 上宣布,将赞助 Space Bunny 在其免费档位中再免费提供几天,以接续这款模型即将结束的免费期。这次公布的安排涉及 OpenCode 对 Space Bunny 免费提供的支持,而模型本身尚处于正式亮相前的调整阶段。据 OpenCode 说明,Space Bunny 正在调优,相关调整还会在正式亮相之前继续进行。

读原文 →

Anthropic扩展CVP:三档开放高级网络能力

开发生态

Anthropic扩展CVP:三档开放高级网络能力

Anthropic 将 CVP 扩展为三档访问方案,为符合条件的安全团队提供高级网络能力及较少拦截的模型访问,覆盖 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Mythos 5.1。

Anthropic 已推出扩展版 Cyber Verification Program(CVP),将此前的 CVP 与 Project Glasswing 整合,按安全工作的范围设置三档访问权限,各档采用不同的验证要求和安全控制。三档均可访问 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 及后续新模型。Defense Access 面向防御任务,包括事件响应、malware 逆向分析及漏洞分析和验证;申请对象包括保护自有或维护系统的机构、关键基础设施运营方、小型安全公司、开源维护者及有漏洞报告记录的个人研究者。官方表示,目标是在数天内回复该档申请。

Red Team Access 在防御用途之外允许经授权的渗透测试和 red-teaming,目前仅接受机构申请,不向个人研究者开放;部署 ransomware、破坏物理系统等可能造成身体伤害或大规模中断的操作仍会被实时拦截。官方预计审核需数周,符合条件的机构在等待期间可先加入 Defense Access。Specialized Access 的网络拦截最少,仅供少数获准测试电网、飞行运行系统等安全系统的已验证机构使用;Anthropic 目前与美国政府合作逐一深入审核,现有 Project Glasswing 成员转入该档,使用当前模型无需重新批准。项目要求保留数据以监测网络滥用,但已有 Claude Fable 5.1 或 Claude Mythos 5.1 零数据保留权限的机构,在 EFS 可用前也可按零数据保留方式使用 CVP。

读原文 →

复旦腾讯浙大开源 Prism,原生 2K 音视频联合生成

模型发布

复旦腾讯浙大开源 Prism,原生 2K 音视频联合生成

复旦大学、腾讯混元与浙江大学团队已开源 Prism,提供原生 2K 音视频联合生成的代码和预览权重,采用 MIT 许可证;据官方实验,其训练速度较全注意力提升 2.5 倍。

复旦大学、腾讯混元与浙江大学团队已发布动态稀疏注意力框架 Prism,并同步开放技术报告、训练与推理代码及预览权重,许可证为 MIT。预览模型基于 MOVA-360p,支持在 720p、1080p 和 2K 分辨率下进行原生音视频联合生成与训练,涵盖文生视频和图生视频。提示词中的 music、sfx、speech 标签分别用于控制配乐、音效和台词。已发布的权重分为偏稳定的 preview-alpha 和偏运动的 preview-beta,Prism-pro 尚未发布。官方表示,实验中 Prism 较全注意力训练提速 2.5 倍,生成质量也超过全注意力。算力要求方面,720p 推理需要单张 80GB 显存 GPU,1080p 和 2K 推理需要 4 张以上 GPU,2K 原生训练至少需要 64 张 GPU。

读原文 →

亚马逊 AGI 团队开源发布 ALoDLM-8B

模型发布

亚马逊 AGI 团队开源发布 ALoDLM-8B

亚马逊 AGI 团队开源发布 ALoDLM-8B,其 exit gate 用变分分布表示退出方案,并采用 c = 0.4 的截断几何先验,以避免对全部方案进行指数数量的独立 rollout。

亚马逊 AGI 团队开源发布了 ALoDLM-8B,其说明介绍了联合建模退出深度的方法。每次确定 token 都会改变尚未确定的 token 所处的上下文,因此退出深度不能分开处理;如果对所有退出方案求和,就需要指数数量的独立 rollout。据其说明,模型改用 exit gate 参数化退出方案上的变分分布 qϕ,并引入 c = 0.4 的截断几何先验 π,使先验偏向较浅的退出深度。

读原文 →

Perplexity 发布决策模型 pplx-decider 新版本

模型发布

Perplexity 发布决策模型 pplx-decider 新版本

Perplexity 已推出开放权重多模态决策模型 pplx-decider-v1.1-27b,模型卡列出的 Decision Index 总分为 61.56;Decision API 每百万输入 token 定价为 0.02 美元,是 v1 的一半。

Perplexity 宣布,更新后的 pplx-decider-v1.1-27b 已可用,Decision API 价格降至 v1 的一半,每百万输入 token 收费 0.02 美元。该模型采用开放权重,支持多模态决策;据模型卡,其骨干仍基于 Qwen3.8-27B,参数量为 26B,精度为 BF16。模型卡列出的 Decision Index 总分由 v1 的 56.4 升至 61.56,领先 Jev 逾 3.5 分。官方表示,该模型在新版 Hugging Face Decision Index 0.3 基准上得分最高,提升主要来自解除因果掩码及增加训练数据,其中包括 tasksource 数据。

读原文 →

EmpirioLabs发布决策模型Aplomb 1

模型发布

EmpirioLabs发布决策模型Aplomb 1

EmpirioLabs 已开放决策模型 Aplomb 1 的 API、Playground 和权重,支持在单次请求中处理多种输入及最多 1,000,000 tokens。官方称,快速模式处理这一长度的文档约需 3 秒,但涉及全文判断时准确率低于完整读取。

EmpirioLabs 的首款决策模型 Aplomb 1 截至 2026 年 10 月 6 日已在其 API 和 Playground 提供,权重通过 Hugging Face 按 EmpirioLabs Model License 发布。模型可在同一请求中接收文本、JSON、图像、音频和视频,输入状态与最长问题合计可达 1,000,000 tokens。面向 Agent,它一次返回每个工具的概率,以及 enum 和 boolean 参数的概率分布;自由文本参数由 Agent 填写。同一状态最多支持 128 个问题,官方表示,各问题独立作答,新增问题不会改变其他答案。启用 abstain 后,输出还会包含输入缺少作答所需信息的概率。

据官方说明,API 和 Playground 对超过 131,072 tokens 的状态默认采用快速长上下文模式,处理 1,000,000 tokens 文档约需 3 秒,完整读取约需 111 秒。在其长上下文测试中,快速模式答对全部 525 个决策,完整读取准确率为 95.2%;但在用于测试计数、整体语气或确认内容从未出现等全文判断的 24 份文档上,两者准确率分别为 50% 和 61%。请求设置 "long_context": "full" 可切换为完整读取,两种模式均按整个状态计算用量。快速模式仅用于其 API 和 Playground,开放权重会读取每个 token。

读原文 →

OpenAI dots 团队称上线一周推出一批改进

产品应用

OpenAI dots 团队称上线一周推出一批改进

OpenAI dots 项目成员 Rohan Varma 表示,团队在上线后一周内根据用户反馈更新了性能、通知、显示与访问功能;后续计划涉及语音可靠性、Codex 应用控制、多台电脑连接及 Windows 本地控制。

OpenAI dots 项目成员 Rohan Varma 表示,团队在 dots 上线后的一周内,已根据用户反馈推出多项改进。据其说明,云端浏览、侧栏加载和动画表现得到调整,等待回复时的停顿也有所减少。修复范围包括使用 ChatGPT 时手机端出现多余通知、Safari 和 Firefox 的字符渲染问题,以及 Outlook 配置卡住。审批界面中按钮被裁切、过大的 Gmail 预览遮挡审批的问题,以及 Web 端和启动语音时的企业访问问题,也在此次修复范围内。团队还调整了 Web 端安全横幅的稳定性,使计划指引更清晰,并在活动加载失败时提供重试方式。后续工作将包括继续提升语音可靠性、扩大 dot 对 Codex 应用的控制范围、支持 dot 连接多台电脑,以及改进 Windows 上的本地电脑控制支持。

读原文 →

ChatGPT 推出 Meetings 插件,自动记录会议笔记

产品应用

ChatGPT 推出 Meetings 插件,自动记录会议笔记

ChatGPT 已推出测试版 Meetings 插件,为会议生成笔记、个性化摘要和后续步骤,并保存至 ChatGPT Space。该功能目前仅供 Pro 和 Business 用户通过 macOS 桌面应用使用。

ChatGPT 目前已上线测试版 Meetings 插件,Pro 和 Business 用户可在 macOS 版 ChatGPT 桌面应用中使用。插件在会议期间记录笔记,并结合 ChatGPT 对用户本人及既往协作内容的了解,生成个性化摘要和后续步骤,保存到 ChatGPT Space。用户可将笔记设为私密或分享给团队,也可随后让 ChatGPT 更新项目计划、起草跟进内容。安装需要先下载桌面应用,再到插件目录搜索 Meetings。官方表示,Enterprise 版即将支持该功能。

读原文 →

Claude 网页与桌面端悄然上线简繁中文界面

产品应用

Claude 网页与桌面端悄然上线简繁中文界面

多名用户发现,Anthropic 的 Claude 网页版和桌面客户端已提供简体、繁体中文界面,均可在设置中手动切换。另有用户发现,部分地区的网页版订阅升级页面可选择中国地址,并显示支持银联国际卡,但有支付尝试遭拒。

据多名用户反馈,Anthropic 的 Claude 网页版与桌面客户端已新增简体中文和繁体中文界面,两端均允许用户通过设置手动切换语言,也有用户发现界面自动变成了中文。差不多同一时间,另有用户在网页版升级订阅时发现,部分地区的页面可以选择中国地址,并显示支持银联国际卡。已有用户尝试付款,但订单被拒绝;这项支付反馈与页面显示的卡片支持信息同时出现在用户报告中。

读原文 →

Claude 上线 Google Workspace 插件

产品应用

Claude 上线 Google Workspace 插件

Claude for Google Workspace 已向所有付费 Claude 套餐开放 public beta,用户可在 Docs、Sheets 和 Slides 内调用 Claude 修改文件;同步推出的三款 beta connectors 支持从 Claude 对话中创建和编辑 Google 文件。

Claude 已向所有付费套餐开放 Claude for Google Workspace 的 public beta,并同步推出 Google Docs、Sheets 和 Slides connectors 的 beta 版本。两种入口分别支持在文件侧栏中操作,以及从 Claude 对话中创建、编辑 Google 文件。据官方说明,侧栏可读取当前文件及选中的文字、单元格或幻灯片,并直接修改内容。Docs 支持局部改写和格式调整,也可用建议卡呈现修改供用户采纳或拒绝;Sheets 支持公式、pivot tables、原生图表和新增工作表,并可通过 Python 处理数据后写回;Slides 可沿用现有布局和主题生成幻灯片,再检查重叠、越界或难以阅读的文字。

官方表示,默认的 Ask before edits 模式会在每次修改前等待批准,Accept all edits 模式则连续执行并应用修改。登录 Claude 账户后,侧栏可使用账户内的 models、connectors 和 skills;Enterprise 套餐的 Compliance API、CMEK 和 OpenTelemetry audit export 也适用于插件。插件可从 Google Workspace Marketplace 安装,通过 Extensions > Claude > Open Claude 打开,管理员可在 Google Admin console 向整个域或指定群组部署。从对话编辑文件需开启对应 connectors,Team 和 Enterprise 套餐须先由 owner 或 primary owner 启用。文件访问权限遵循现有 Google 共享权限,受支持的配置可在对话旁的面板打开文件。

读原文 →

谷歌 Docs 与云盘原生支持 .md 文件,可实时编辑评论

产品应用

谷歌 Docs 与云盘原生支持 .md 文件,可实时编辑评论

Google Docs 和 Google Drive 已加入 Markdown 原生支持,用户可直接打开、编辑和评论 .md 文件。功能从 2026 年 10 月 5 日起推送,部分用户最多需等待 15 天。

Google 自 2026 年 10 月 5 日起向 Google Docs 和 Google Drive 推送 Markdown 原生支持,部分用户可能需要等待最多 15 天。用户打开 .md 文件后,可直接查看渲染后的内容,包括可点击的链接和结构化表格,并进行实时编辑和评论,无需先将文件转换为其他格式的描述未在原文中提供。官方表示,该功能可让 AI Agent 协作编辑文档,并可与 Gemini Notebook 同步。Google 员工 Chandu Thota 将 Markdown 描述为人类与 AI Agent 之间的通用语言。

读原文 →

ElevenLabs 发布对话式 Agent 专家 Architect

产品应用

ElevenLabs 发布对话式 Agent 专家 Architect

ElevenLabs 发布内置于 ElevenAgents 的 Architect,现以 Alpha 版开放,支持通过语音或文字创建和改进 AI Agent。官方表示,它可分析数千段对话,提交已构建并经模拟测试验证的修改提案。

ElevenLabs 已发布 ElevenAgents Architect,并以 Alpha 版开放,用户可在 ElevenAgents 内通过语音或文字对话创建和改进 AI Agent。该功能也可从 Claude、Claude Code、ChatGPT、Cursor 和 Grok Bot 调用,并带入 Agent 的完整上下文。据官方说明,Architect 了解 ElevenAgents 的全部配置选项,覆盖知识库、prompt、工作流、语音设置、procedures、guardrails、工具和模拟测试的最佳实践。它可分析对话记录、定位问题根因并提出修改,也能在数千段对话中寻找团队可能遗漏的改进机会;返回的每项提案均已构建完成,并在模拟测试中验证。

读原文 →

Claude Code 云端会话实战指南发布

技术与洞察

Claude Code 云端会话实战指南发布

claude.dev 发布 Claude Code 云端会话指南,介绍独立机器上的并行任务与套餐计费规则。指南中的三个任务在 16 秒内陆续启动,首个任务启动后 87 秒全部完成,云端机器不另收费。

claude.dev 发布了 Claude Code 云端会话实战指南,说明任务隔离、启动入口和使用限制,原文未注明发布日期。据其说明,每个任务获得独立的虚拟机,仓库克隆到新分支并完成环境设置,产出可转为 pull request;会话可从 claude.ai/code、Claude mobile app、Desktop app、terminal 和 Slack 启动。Pro、Max、Team、Enterprise 套餐包含云端会话,不另收机器费用,但共用 Claude Code 使用额度,部分组织需由所有者先启用。指南用示例 Node API 仓库测试了三个并行任务,分别处理不稳定测试、过时 API 文档和 logger 字符串拼接;它们在 16 秒内启动,各运行 61、65、72 秒,首个启动后 87 秒全部完成。每个会话先从提示中的文件重建仓库,这一步约占各次运行的三分之一至略超一半。

读原文 →

Sierra 联合 Meta、Stripe 和沃尔玛等开发个人 Agent 开放标准

技术与洞察

Sierra 联合 Meta、Stripe 和沃尔玛等开发个人 Agent 开放标准

Sierra 与 Meta 及 Stripe、沃尔玛等伙伴共同开发 Personal Agent Protocol,让个人 Agent 按用户授权与企业交互;该标准向所有人开放实施,官方计划发布 v0.1 规范。

Sierra 宣布与 Meta、Genesys、Instinct、Rocket、Shopify、Stripe 和沃尔玛共同开发开放标准 Personal Agent Protocol,原文未注明公告日期。官方表示,该标准旨在处理身份认证,让用户决定个人 Agent 的访问权限,并让企业设定其操作范围、了解其活动。交互从企业网站开始,Agent 发现服务与连接方式后,可代表用户建立访客会话,查询商品库存或退货政策;访问账户时,用户可在企业页面登录,或使用已为个人 Agent 配置的凭据,并选择只读或写入权限。会话基于 OAuth,跨渠道保留登录前后的交互。企业可提供网站、API 或自有 Agent 作为连接路径。该标准允许任何人实施;官方还计划发布 v0.1 规范、举办设计研讨会,并提供 reference implementation。

读原文 →

OpenAI 联手 Ironclad 用合同工作流训练 AI agent

技术与洞察

OpenAI 联手 Ironclad 用合同工作流训练 AI agent

OpenAI 与 Ironclad 合作,将合同工作流整理为 11 项 AI agent 训练和评测任务。官方评测显示,GPT-6 Astra 平均得分比 GPT-5.6 Sol 高 32%,结果仅限于这些研究任务。

OpenAI 宣布与合同管理软件公司 Ironclad 开展研究合作,将复杂合同工作流用于 AI agent 的训练和评测,Ironclad 是首个合作伙伴。双方设置了 11 项涉及法律、商务和采购的任务,包括设置保密协议、创建采购审批流程,每项采用 8 到 50 条标准评估。据其说明,有经验的用户完成每项任务平均需要 30 到 40 分钟,合作目标是提升模型使用专业软件处理复杂业务问题的能力。

据官方说明,GPT-6 Astra 是首个在这些任务上训练的前沿模型。在研究评测中,其平均得分为 55.0%,GPT-5.6 Sol 为 41.6%,前者比后者高 32%;每次尝试的估计时间分别为 19.2 分钟和 37.0 分钟,前者比后者低 48%。OpenAI 表示,这些结果只覆盖上述 11 项任务,时间来自模拟估计,并非客户实际节省时间的测量结果。OpenAI 同时邀请少量软件公司申请类似的研究合作。

读原文 →

GitHub 重建 Git 基础设施,面向 Agent 开发

技术与洞察

GitHub 正在重建 Git 基础设施,以承接开发者与 AI Agent 并发工作的负载;过去一年,月度 Git 事件从 2182 亿增至 4733 亿,新架构在内部测试中的写入吞吐量最高达到原来的 35 倍。

GitHub 正在平台持续运行期间改造 Git 基础设施,以支持开发者与 AI Agent 并发工作,用户无需改变现有构建方式。过去一年,月度 Git 事件总量从 2182 亿增至 4733 亿,超过原来的两倍;9 月提交数为 73.8 亿次,超过一年前的五倍;推送量同比增长 4.9 倍,达到每月 33.5 亿次。据 GitHub 说明,现有 Spokes 架构将持久化与读扩展耦合,增加读副本会拖慢写入,限制高活跃仓库的容量。改造后的协调仅覆盖需要一致性的引用更新,压缩、垃圾回收等维护工作移出服务路径,Azure Blob Storage 保存权威数据,轻量缓存节点随流量增减以提供读容量。内部基准测试显示,新架构写入吞吐量最高为原来的 35 倍,读容量可独立扩展。官方表示,这一基础已在落地,后续系列文章将介绍架构细节。

读原文 →

SemiAnalysis 实测:Anthropic 订阅价值约为 OpenAI 五倍

技术与洞察

SemiAnalysis 实测:Anthropic 订阅价值约为 OpenAI 五倍

SemiAnalysis 推出面向 Tokenomics Model 订阅者的 AI 订阅监测面板,覆盖 OpenAI、Anthropic 等供应商,通过实测区分模型与 token 类型的额度消耗,而非仅按月费比较价值。

SemiAnalysis 推出了仅向 Tokenomics Model 订阅者开放的 Subscriptions Dashboard,用于追踪 AI 订阅额度,原文未注明上线日期。监测范围包括 OpenAI、Anthropic、Meta、SpaceXAI、Cursor、Cognition、Z.ai、MiniMax 和 Moonshot。据其说明,同一每月 200 美元的 Claude 方案,其 API 等价价值会随模型和工作负载变化,不能只凭月费判断。测试分别隔离 Input、Cache write、Cache read 和 Output,记录供应商计费的 token 数量及用量表变化,再以完整刻度区间计算额度消耗率;首尾未完成的区间不纳入计算。文中还指出,供应商既会公开调整限额,也可能通过修改额度消耗成本而不公告地改变限额,因此单次测量不足以反映持续变化。

读原文 →

a16z 消费 AI 百强榜首次新增支出排名

技术与洞察

a16z 消费 AI 百强榜首次新增支出排名

a16z 在第七期消费 AI 百强榜中首次加入美国消费者支出排名,补充流量榜未覆盖的产品。样本中支出最高的 10% 用户贡献约一半支出,ChatGPT 的美国付费订阅人数为 Claude 或 Gemini 的 3 倍。

a16z 在第七期消费 AI 百强榜发布时首次新增支出排名,采用 YipitData 观测到的美国消费者银行卡支出数据。新排名覆盖数十家未进入网页和移动榜单的供应商,包括桌面应用和现有消息平台内的 Agent。其数据仅来自美国样本面板,并非全量统计。原有榜单仍以 Similarweb 的月访问量评选 50 款网页产品,以 Sensor Tower 的月活跃用户数评选 50 款移动应用;本期首次上榜的产品为 11 款,是七期中最少的一次。

据 a16z 对样本数据的说明,支出最高的 10% 用户贡献了约一半的观测支出,这些用户更倾向于购买编程、生产力和创作工具。YipitData 面板显示,ChatGPT 的美国消费者付费订阅人数为 Claude 或 Gemini 的 3 倍,仅 8% 的美国 ChatGPT 订阅者同时订阅 Claude。Claude 消费者付费用户中,7.3% 选择每月 100 美元起的 Max;Google 和 ChatGPT 对应的每月 100 美元订阅占比分别为 1.3% 和 1.1%。

读原文 →

Nous Research 发布 Hermes Index 智能体模型榜

技术与洞察

Nous Research 发布 Hermes Index 智能体模型榜

Nous Research 发布 Hermes Index,以四套评测的平均得分和单任务平均成本呈现模型的 Agent 能力。页面还介绍了包含 150 项任务、覆盖 25 个类别的 Hermes Bench,评分会检查任务结束后留下的文件与状态。

Nous Research 在其 portal 页面公布 Hermes Index 模型榜,将 Hermes Agent 内运行的四套评测结果汇总为平均得分和单任务平均成本。页面说明,得分越高代表表现越好,用户最多可选择四个模型,对比各套评测的得分与成本;得分与成本图中的连线模型,其得分均高于所有成本更低的模型。页面另列出 Hermes Bench 的测试设置:150 项任务分布于 25 个类别,涉及 Hermes skills、研究、图表与艺术、记忆、工具使用及安全。每个 Agent 从带有真实文件的工作区开始执行任务,部分任务加入后续交互轮次,评分器检查最终留下的文件与状态。

读原文 →

世卫非洲团队借 Google Earth AI 快速锁定埃博拉暴露区

技术与洞察

世卫非洲团队借 Google Earth AI 快速锁定埃博拉暴露区

在刚果民主共和国埃博拉疫情期间,世卫组织非洲区域办事处与当地研究机构使用 Google Earth AI 的两项研究原型。Google 表示,相关工具已帮助团队在几分钟内找到面临埃博拉风险的偏远社区。

世卫组织非洲区域办事处的达喀尔应急准备与响应中心,以及刚果民主共和国国家生物医学研究所(INRB)的流行病建模与情报部门(UMIE),在该国埃博拉疫情期间使用了 Google Earth AI 的两项研究原型,原文未提供具体日期。其中,Geospatial Reasoning agent 支持通过自然语言对话开展空间制图,planetary prediction engine 用于自主预测疾病。Google 表示,这些工具将环境信号、卫星影像、流动数据与基础模型结合,以补充现有卫生信息并弥补报告缺口。其 Population Dynamics Foundation Model(PDFM)整合汇总搜索趋势、人口流动及环境模式,相关 embeddings 已通过 Google Maps Platform 的 Population Dynamics Insights 以 Preview 形式商业提供。研究人员可针对特定用途申请免费访问,符合条件的机构可通过 GMP Public Programs 申请 Google Earth credits。Google.org 还向 INRB 提供了资金,用于帮助更新当地检测与疾病监测能力。

读原文 →

Opus 5.5 Agent 三天找出两种室温磁性半导体

技术与洞察

Opus 5.5 Agent 三天找出两种室温磁性半导体

Vals AI 表示,90 多个 Claude Opus 5.5 Agent 用 3 天完成数百次云端量子力学模拟,筛出两种室温磁性半导体候选;其带隙与自旋分选能力仍未经过实测。

LLM 评测机构 Vals AI 发布博文称,90 多个 Claude Opus 5.5 Agent 在为期 3 天的云端计算中运行数百次量子力学模拟,找到两种面向自旋电子学存储的室温磁性半导体候选。据其说明,两者属于净磁矩为零、却能按自旋分选电子的 Luttinger 补偿磁体。已有材料 KV[Cr(CN)₆] 于 1999 年首次合成,当年实测磁序保持到 376 K;此次计算预测其带隙约为 2.1 eV,两条带边位于同一自旋通道。另一候选 YBaMnFeO₅ 是新设计,预测带隙为 2.35 eV,磁序保持到约 420 K,但合成所需的原子棋盘排列容易被打乱,可能难以制备。Vals AI 强调,这些结果基于理想晶体,带隙和自旋分选均未实测;下一步是重新合成 KV[Cr(CN)₆] 并测量,全部计算数据及一键校验程序已在 GitHub 公开。

读原文 →

五角大楼确认停用 Anthropic 全部产品

行业动态

美国国防部向 BBC 确认已停用 Anthropic 全部产品,此前曾要求在六个月内完成退出。多名知情人士称,Claude 此前仍用于情报分析及对伊朗军事行动,并嵌入五角大楼的数据平台。

美国国防部在回复 BBC 的声明中确认,已停止使用 Anthropic 的全部产品,但未说明具体停用日期及延期原因。国防部长 Pete Hegseth 此前以国家安全为由,将 Anthropic 列为供应链风险,并设定六个月的退出期限。争议源于五角大楼要求移除 Claude 的安全限制,让军方不受限制地使用其 AI 产品;Anthropic 因担忧大规模监控和自主武器而拒绝,并起诉特朗普政府,试图撤销该认定。诉讼期间,五角大楼已与 Google、xAI 和 OpenAI 等公司签订合同。

据多名知情人士向 BBC 说明,Claude 在停用声明发布前仍用于研究、分析、情报收集及对伊朗军事行动,也嵌入了 Palantir 运营的 Maven Smart System。该平台是五角大楼组织情报及其他数据的主要平台。消息人士称,分析人员通过 Maven 获取和整理卫星图像、无人机影像等视觉数据,再交由 Claude 和其他 large language models 处理,包括识别潜在军事目标。Georgetown 的安全与新兴技术中心高级研究分析员 Lauren Kahn 表示,Claude 与 Maven 的深度整合使快速移除变得困难。Anthropic 发言人拒绝就停用声明置评。

读原文 →

Anthropic 扩大 Claude Startups 计划

行业动态

Anthropic 扩大 Claude Startups 计划

Anthropic 扩大 Claude Startups 计划,面向基于 Claude 创业的团队,提供最高 7,000 美元的产品与额度,以及最高 45,000 美元的工具折扣与额度,申请资格取决于成立或融资时间。

Anthropic 宣布扩大 Claude Startups 计划,向更多基于 Claude 构建公司的创业者开放申请。官方表示,成员可获得最高 7,000 美元的 Claude 产品与额度,福利包括一年的 Claude Team plan、API credits,以及与 Anthropic Applied AI 团队交流的 office hours。新增的 Claude Startup Stack 覆盖销售、设计和数据工程等工具,成员可从使用 Claude 构建产品的公司获得最高 45,000 美元的折扣与额度。计划还提供客户拓展、技术问题处理和创业者之间的交流支持。过去五年内成立,或过去两年内获得融资的初创公司符合申请条件;申请入口位于 Claude Startups 页面。

读原文 →

OpenAI 计划合并 Chat 与 Work 开关

前瞻与传闻

OpenAI 计划合并 Chat 与 Work 开关

所附 YouTube 素材的标题称,OpenAI 计划合并 Chat 与 Work 开关,但正文只有网页配置代码,没有提供计划的发布时间、生效日期或关键数字,也没有可用于核实标题的产品说明。

所附 YouTube 素材以 OpenAI 计划合并 Chat 与 Work 开关为题,但未注明计划何时发布或生效。可读的正文是 YouTube 页面初始化与功能配置代码,不含视频讲稿、产品公告或 OpenAI 官方说明。因此,这份素材能够支持的内容仅限于标题所述的合并计划,无法据此确认具体改动、适用范围、推出安排,或该计划是否已经实施。

读原文 →

消息称 OpenAI 洽谈 300 亿美元新融资

前瞻与传闻

据知情人士透露,OpenAI 正洽谈一轮 300 亿美元融资,参与谈判的阿联酋基金包括 MGX,合计出资额讨论上限为 100 亿美元。BlackRock 也在商谈参与,融资细节仍可能变化。

据知情人士透露,OpenAI 正与多家阿联酋投资基金及 BlackRock 洽谈,拟为这家 ChatGPT 开发商筹集 300 亿美元。阿联酋基金中包括总部位于阿布扎比的 MGX;一名知情人士称,这些基金计划组成投资联合体,参与本轮融资,讨论中的合计出资额最高为 100 亿美元。BlackRock 商谈的安排是与该联合体共同参与。上述消息来自要求匿名的知情人士,他们表示,融资仍在进行,具体安排可能调整。

读原文 →

曝DeepSeek融资至少800亿元,腾讯宁德时代领投

前瞻与传闻

曝DeepSeek融资至少800亿元,腾讯宁德时代领投

据彭博援引知情人士报道,DeepSeek 即将完成至少 800 亿元人民币的新一轮融资,腾讯和宁德时代承诺出资规模居前;按已签署的条款书,最终融资总额可能接近 1000 亿元。

据彭博援引知情人士报道,DeepSeek 的新一轮融资即将收尾,金额至少为 800 亿元人民币。公司最初寻求约 500 亿元,最新 AI 模型发布后,认购需求超过预期;依据已签署的条款书,最终总额可能接近 1000 亿元。腾讯和宁德时代是本轮承诺出资规模居前的投资方。彭博称,这轮融资将为 DeepSeek 计划于 2027 年初进行的 IPO 铺路。相关细节尚未公开,路透社表示,DeepSeek、腾讯和宁德时代均未立即回应置评请求。

读原文 →

消息称月之暗面完成上市前融资,估值约500亿美元

前瞻与传闻

消息称月之暗面完成上市前融资,估值约500亿美元

据彭博社援引知情人士的消息,月之暗面完成上市前最后一轮私募融资,估值约 500 亿美元,并计划于 2027 年第一季度赴香港 IPO,募资上限为 50 亿美元,最早于 2026 年 10 月举行先期意向会议。

彭博社于 2026 年 10 月 6 日报道,知情人士称月之暗面已完成上市前最后一轮私募融资,估值约 500 亿美元,计划于 2027 年第一季度在香港进行 IPO,募资上限为 50 亿美元。据报道,公司此前已以保密方式向港交所递交申请,并开始筹备投资者摸底沟通,先期意向会议最早于 2026 年 10 月开展。此次上市由美国银行担任整体协调人,中金公司、德意志银行和高盛担任保荐银行。

读原文 →

消息称可灵 AI 选定投行,拟赴港 IPO 募资至少 10 亿美元

前瞻与传闻

据彭博社援引知情人士消息,快手旗下可灵 AI 已选定承销银行,拟在香港 IPO 募资至少 10 亿美元,目前正与中金、高盛及瑞银推进发行筹备。相关讨论尚未结束,融资规模和上市时间仍可能调整。

据彭博社援引知情人士消息,快手科技旗下的可灵 AI(Kling AI)在消息披露时已选定承销银行,正在筹备香港 IPO,计划募资至少 10 亿美元,原文折合约 67.14 亿元人民币。参与潜在股票发行筹备的银行包括中金公司、高盛集团和瑞银集团;知情人士表示,商讨仍在进行,募集金额及上市时间尚可能变化。可灵 AI 成立于 2024 年,提供 AI 视频服务并寻求商业化。其一轮融资金额为 28 亿美元,原文折合约 188.01 亿元人民币,投资方包括阿里巴巴、腾讯和百度。原文还称,该轮融资完成后,可灵 AI 的投前估值约为 150 亿美元,折合约 1,007.17 亿元人民币。其竞争对手包括字节跳动旗下 Seedance,以及同样计划在香港 IPO 的生数科技和 PixVerse。

读原文 →