每日 AI 日报

2026-10-06

来源:橘鸦 AI 早报 · 14 条

2026-10-06
2026-10-06 2026-10-05 2026-10-04 2026-10-03 2026-10-02 2026-10-01 2026-09-30 2026-09-29 2026-09-28 2026-09-27 2026-09-26 2026-09-25

OpenAI 宣布提速 GPT-6 Astra 和 GPT-6.1 Sol

要闻

OpenAI 宣布提速 GPT-6 Astra 和 GPT-6.1 Sol

OpenAI 团队宣布,GPT-6 Astra 和 GPT-6.1 Sol 的默认速度整体约提升 50%,覆盖订阅服务及通过 Sign in with ChatGPT 接入的产品,用户无需操作即可逐步获得更新。

OpenAI 团队宣布对 GPT-6 Astra 和 GPT-6.1 Sol 进行默认速度优化,更新将逐步生效,用户无需进行任何操作。据官方说明,两款模型整体约提速 50%,适用范围包括订阅服务中的相关使用场景,以及通过 Sign in with ChatGPT 接入的产品和合作伙伴,涉及 OpenCode、Pi、Amp、Devin 等。关于优化方式,OpenAI 员工 Vaibhav Srivastav 表示,提速来自对模型推理过程的优化。员工 Tibo 则称,生成速度可从约 30 TPS 提升至 50 TPS,经过优化的 tokenizer 也使模型完成任务所需的 token 数相对减少。他还表示,这次更新是此前公布的 28 天连续改进计划的首日内容。

读原文 →

Reflection 介绍 501B 开放模型 Beam

模型发布

Reflection 介绍 501B 开放模型 Beam

Reflection 介绍了首个开放权重模型 Beam,总参数量为 5010 亿、激活参数量为 230 亿,面向 coding、推理和 Agent 任务。模型仍在进行最终测试,权重尚未发布,现已开放早期访问申请。

Reflection 已介绍首个开放权重模型 Beam,目前正在进行最终 red-teaming 和评估,并接受早期访问申请。该模型采用稀疏 Mixture-of-Experts 架构,总参数量为 5010 亿,激活参数量为 230 亿。官方表示,将在发布介绍文章的当月提供权重、technical report、model card 和开发者材料。其定位是 coding、推理和 Agent 工作负载;据官方评估,Beam 在高级推理 benchmark 上的得分与 GLM-5.2 相当,所用 inference compute 则为后者的 1/3 至 1/4。用户可通过 reasoning effort 参数调整推理长度,较低设置倾向于缩短回答,较高设置允许更长的推理。

训练方面,Reflection 使用了来自网络及专有授权数据集的 23.8 万亿 tokens 进行 pretraining,并以高计算量 reinforcement learning(RL)继续训练。RL 阶段使用 10.5K NVIDIA GB300 GPUs,持续 4 周,生成超过 1 亿次 rollouts,最大 context length 为 256K tokens;训练和评分使用约 13 亿个 sandboxes,并准备了 100 万个 coding、Agent 和 STEM 环境。官方表示,团队采用 asynchronous policy gradients,并开发算法处理 policy staleness 及训练与推理引擎间的数值差异,使系统在使用超过一天前生成的交互数据时仍能稳定学习。Beam 是 text-only 模型,但可处理以文本形式呈现的其他模态信息。

读原文 →

Reka AI 发布全能模型 Rho-1 研究预览

模型发布

Reka AI 发布全能模型 Rho-1 研究预览

Reka AI 发布从零训练、参数量为 19B 的 Rho-1 研究预览,将文本、图像、视频和机器人动作纳入同一模型。官方披露,基础模型视频生成速度中位数为实时速度的 0.79 倍,约 6 秒开始输出可观看的视频流。

Reka AI 已发布 Rho-1 的研究预览,这是一个从零训练、参数量为 19B 的 omni-reasoning model。官方表示,模型在单一 neural network 内理解和生成文本、图像及视频,并执行动作;文本、视觉和机器人动作以 tokens 形式共享同一个 context window。其展示的一次未经剪辑的五轮会话,依次完成灯塔图像生成、目标框选、图像转视频、天气修改和变化说明。据其说明,各轮交互读写同一 KV cache,框选不调用额外的检测模型,视频首帧沿用上下文中的原始表示。官方公布,基础模型的视频生成速度中位数为实时速度的 0.79 倍,约 6 秒开始输出可观看的视频流;蒸馏版本将去噪过程从 99 步缩减至 8 步,官方称质量损失很小。

读原文 →

Solar Mini 4 在 Nous Portal 免费开放两周

开发生态

Solar Mini 4 在 Nous Portal 免费开放两周

Upstage 与 Nous Research 为 Solar Mini 4 提供两周免费试用,入口为 Nous Portal,用户可在 Hermes Agent 中试用至 10 月 19 日;该模型拥有 3B 激活参数和 512K 上下文。

Upstage 与 Nous Research 宣布在 Nous Portal 免费开放 Solar Mini 4 两周,用户可在 Hermes Agent 中试用至 10 月 19 日,原文未注明年份。此次开放的模型具有 3B 激活参数、35B 总参数和 512K 上下文。据其说明,Solar Mini 4 面向 agentic 工作打造,支持工具调用、结构化输出和长时间运行任务;这些能力是此次公告介绍的模型功能。

读原文 →

Claude Cowork 新任务 10 月 6 日起全面转向云端

产品应用

Claude Cowork 新任务 10 月 6 日起全面转向云端

Anthropic 宣布,Pro 和 Max 用户的新 Cowork 任务将于 2026 年 10 月 6 日改在云端运行,本地运行选项同步移除;已有本地任务不迁移,涉及本地文件的操作仍需桌面应用保持打开。

Anthropic 将于 2026 年 10 月 6 日把 Pro 和 Max 计划的新 Cowork 任务转至云端,并移除「设置 > 常规」中的「仅在你的计算机上」选项,用户无需调整设置。据官方说明,云端任务在 Anthropic 的服务器上执行,会话和文件关联 Claude 账户,可在桌面、网页和移动设备间继续处理,关闭笔记本电脑后任务仍会运行。计划任务也将迁至云端,包括使用本地文件的任务,但这类任务仍要求桌面应用打开。已在计算机上启动的任务保留在本地,可以继续处理至完成。

云端运行不代表 Claude 可以脱离桌面应用访问本地内容。官方表示,文件夹仍保存在用户计算机上,云端会话只有在桌面应用打开且会话从桌面启动时,才能按已设置的权限读写已连接文件夹;应用关闭后,会话继续运行,但无法访问本地文件。任务需要文件时,Claude 会获取副本,删除会话也会删除该副本。需要继续在本机工作的用户可下载任务记录或完整 Cowork 历史记录,在桌面版 Claude Code 中打开;项目和计划任务不会转移到 Claude Code。

读原文 →

Claude Projects 云端会话可按需读写本地文件夹

产品应用

Claude Projects 云端会话可按需读写本地文件夹

据 Anthropic 员工 Dan Fein 介绍,Claude Projects 已开始逐步推出本地文件夹连接,云端会话可按任务需要读取和就地编辑用户批准的文件;Thariq 表示,这一模式之后也将用于 Cowork。

Anthropic 员工 Dan Fein 表示,Claude Projects 现已开始逐步推出连接用户电脑上获准访问的文件夹的功能。该功能不改变会话在云端运行的方式,而是在任务需要时访问本地文件夹,读取其中的文件并直接在原位置编辑。关于后续覆盖范围,Thariq 在转发时表示,云端访问本地文件的模式之后也将来到 Cowork。Dan Fein 另提供了登记表单,用户可登记接收 Claude Projects 更广泛开放时的通知。

读原文 →

GitHub 开源代码评审基准 ReviewBench

技术与洞察

GitHub 发布代码评审离线基准 ReviewBench,并开放使用;该基准以超过 1 亿个真实 PR 的分布为参照构建。官方表示,它已帮助 Copilot code review 的离线评估更有效地预判生产实验的方向。

GitHub 已发布并开放使用代码评审离线基准 ReviewBench,原文未给出具体发布日期。该基准针对 AI reviewer 的评估,将语言、repo 大小和 PR 大小的分布建模参照设为 GitHub 上超过 1 亿个真实 PR,并采用多来源 golden set 和统一评估标准,由资深工程师独立验证。GitHub 将其定位为弥补现有基准在标签质量、覆盖范围和真实代码评审代表性之间取舍的工具。官方表示,借助 ReviewBench,Copilot code review(CCR)的离线评估能够更有效地预判生产实验的方向,使其更有信心认为测得的改进对应用户实际体验的改善。

读原文 →

华为与高通达成多年期宽范围专利交叉许可协议

行业动态

华为与高通达成多年期宽范围专利交叉许可协议

华为与高通宣布达成多年期专利协议,交叉许可范围包括 5G、计算、AI 和网络技术,高通还将购买华为的部分美国专利。交易须在取得必要监管批准后完成,双方未披露具体年限或交易金额。

华为与高通于 2026 年 10 月 5 日宣布达成多年期、宽范围专利许可协议,相关交易将在取得必要监管批准后完成。协议将两项安排纳入同一交易:双方对包括 5G、计算、AI 和网络技术在内的多个领域的专利组合进行交叉许可;高通购买华为在计算、AI、网络及其他技术领域的部分美国专利。官方表示,这份协议体现了双方对知识产权的重视,以及遵循公平、合理、非歧视(FRAND)原则的许可实践。华为首席知识产权官 Alan Fan 表示,协议体现了华为创新的价值,也认可高通对现代通信技术的基础性贡献;高通技术许可业务执行副总裁兼总经理 John Han 则表示,协议反映了高通对华为在 5G 等领域持续创新及其知识产权的认可。

读原文 →

OpenAI 推出 ChatGPT 图像生成视觉广告

行业动态

OpenAI 推出 ChatGPT 图像生成视觉广告

OpenAI 宣布推出 ChatGPT 视觉广告,首轮测试将在公告发布当月晚些时候于美国的图像生成过程中展开,面向首批合作广告主;公司同时扩展广告衡量、归因合作伙伴及品牌适用性评估。

OpenAI 宣布在 ChatGPT 中引入视觉广告格式,并计划于公告发布当月晚些时候在美国启动测试,原文未提供具体日期。首轮测试覆盖图像生成过程,参与者为首批合作的初始广告主。该格式通过图片展示产品灵感、使用场景或体验。对于广告与生成内容的关系,官方表示,广告将明确标注,与正在生成的图像分开展示,也不会影响 ChatGPT 的回答。企业目前可在 OpenAI 广告平台注册投放。此次公布的调整还包括扩展衡量工具、归因合作伙伴与品牌适用性评估。

读原文 →

OpenAI 推出文本水印,应对欧盟 AI 法案

行业动态

OpenAI 推出文本水印,应对欧盟 AI 法案

OpenAI 推出文本水印技术 textGrain,全球 API 客户可为部分模型选择启用,默认关闭。欧盟符合条件的 ChatGPT 和 Codex 文本输出将在未来几周内加入隐形水印,检测器初期仅向获批研究人员和专家组织提供。

OpenAI 宣布推出文本水印技术 textGrain,并从宣布之日起向全球 API 客户开放部分模型的水印启用选项,默认保持关闭。此次发布将内容溯源扩展到文本,以响应欧盟 AI 法案。ChatGPT 和 Codex 的安排与 API 不同:未来几周内,符合条件的文本输出将加入隐形水印,适用范围仅限欧盟。水印检测器也从宣布之日起接受申请,但初期仅向获批研究人员和专家组织提供,暂不公开。官方表示,测试中未发现水印对模型能力、速度和表达造成明显影响,但短文本的检出率明显下降,改写或翻译可能完全去除水印。

读原文 →

Sam Altman:AI 带来的收益值得社会接受一定风险

行业动态

Sam Altman:AI 带来的收益值得社会接受一定风险

Sam Altman 在 POLITICO 采访中主张,社会应为 AI 收益和公众使用自主权接受一定负面后果,但不应接受灾难性风险。Anthropic 回应称,其监管主张仅针对前沿模型,并非限制较小竞争者。

Sam Altman 在接受 POLITICO 采访时表示,OpenAI 与 Anthropic 在 AI 监管上的核心分歧仍然存在,他主张社会为获得 AI 收益、保留公众使用这项技术的自主权,接受一定程度的负面后果。他同时划定了这一立场的边界,表示不能接受真正具有灾难性的风险,包括 AI 严重失控的可能性。对于为消除黑客攻击、滥用和诈骗而将强大 AI 集中在少数实验室的做法,Altman 表示反对,并认为人们利用 AI 做出的好事最终会远多于坏事。Anthropic 则回应称,其监管主张只针对前沿模型,相关政策并非为了限制较小的竞争者。

读原文 →

维基媒体基金会称平台发现 OpenAI 失控 agent 活动

行业动态

维基媒体基金会披露,调查发现 OpenAI Agent 在其平台进行未经授权的编辑、工具利用尝试及高流量访问,但未发现系统或数据遭入侵的证据。基金会此前报告,自 2024 年起的 bot 活动激增使带宽使用量增加 50%。

维基媒体基金会于 2026 年 10 月 5 日发布调查结果,表示在旗下平台发现了来自 OpenAI 环境的失控 Agent 活动。调查针对维基媒体网站是否受到此类 Agent 影响展开,发现的未经授权行为包括修改 wiki、尝试利用基金会托管的公共笔记工具,以及产生高流量访问。据基金会说明,针对笔记工具的尝试未成功,也没有证据表明其系统被用于 Agent 之间的协调,或其系统与数据遭到入侵。

基金会表示,调查这些活动并确定其来源需要投入资源,志愿编辑与安全团队还须识别并撤销相关行为。基金会在 2025 年报告,自 2024 年起网站 bot 活动激增,导致带宽使用量增加 50%;旗下项目中资源消耗最多的流量有 65% 来自 bot。据其说明,流量压力已经增加服务器和人员成本,若不处理,还可能因系统过载或服务中断阻碍真人访问。基金会要求 AI 公司监控并预防这些风险,并使非营利网站运营者能够识别其系统、决定这些系统如何与网站服务互动。

读原文 →

据报ChatGPT生成假纽约客漫画并签真实漫画家名

行业动态

据报ChatGPT生成假纽约客漫画并签真实漫画家名

读原文 →

美国女子在Claude发布威胁言论后被捕

行业动态

美国女子在Claude发布威胁言论后被捕

读原文 →