Epoch 0
JA · EN
每日 AI 日报
2026-08-29
来源:橘鸦 AI 早报 · 11 条
腾讯发布并开源 Hy4 preview 模型
要闻
腾讯发布并开源旗舰模型 Hy4 preview,总参数 770B、每个 token 激活 49B,上下文窗口为 1M。其 API 已上线腾讯云和 OpenRoute,并接入 WorkBuddy 等产品。
腾讯已正式推出新一代旗舰模型 Hy4 preview,并依据 Apache 2.0 协议开放模型权重;其 API 已上线腾讯云和 OpenRoute,模型也已接入 WorkBuddy、CodeBuddy、元宝和 ima 等产品。Hy4 preview 总参数为 770B,每个 token 激活 49B 参数,上下文窗口为 1M,注意力模块采用 Gated DSA,残差路径使用 iHC。官方表示,模型重点提升了软件工程、办公分析、游戏开发和科学研究等生产力场景的能力;据腾讯公布的盲测数据,内部专家对多个工程任务的评估显示,其表现略优于 GLM-5.3 和 Kimi K3。WorkBuddy 宣布首发接入 Hy4 preview,并限时免费至 2026 年 9 月 10 日;Hy3 的免费期限则延长至 2026 年 9 月 30 日。
读原文 →
智谱修复 GLM-5.3-Flash 参数配置异常并发放等额赠金
要闻
智谱已修复 GLM-5.3-Flash 的参数配置异常,并称模型能力现已恢复;受影响期间通过 GLM CodingPlan 或 API 使用该模型的用户,将按实际用量获得等额赠金。
智谱已完成 GLM-5.3-Flash 的配置更新并修复参数配置异常,更新现已生效,同时将向受影响用户发放赠金。此前,该异常导致模型在部分 Agentic 用例中的表现下降;据其说明,模型能力目前已恢复正常。智谱官方运营表示,在受影响期间通过 GLM CodingPlan 或 API 使用过该模型的用户,都将依据实际用量获得等额赠金。智谱团队成员 Zixuan Li 确认配置更新已经推出,并建议曾在既有工作流中遇到表现不佳的用户重新尝试。
读原文 →
智谱发布 GLM-5.3 模型权重
模型发布
智谱已发布 GLM-5.3 开放权重模型,并开放模型下载与本地部署。官方表示,其基础模型与 GLM-5.2 相同,能力提升全部来自后训练,重点涉及 Agentic 编码和网络防御。
智谱发布了 GLM-5.3 开放权重模型,模型现已开放下载和本地部署。官方表示,GLM-5.3 与 GLM-5.2 采用相同的基础模型,模型的全部提升均来自后训练,并称其在 Agentic 编码和网络防御方面表现更强。据其说明,本地部署支持 SGLang、vLLM、TokenSpeed、Transformers、KTransformers 和 Unsloth 等框架;在 Ascend NPU 平台上,模型还支持使用 vLLM-Ascend、xLLM 和 SGLang 进行推理。
读原文 →
Claude Code:新增桌面端接续 CLI 会话及多项性能优化
开发生态
Anthropic 已更新 Claude Code,桌面端可用 /resume 接续 CLI 会话并保留完整上下文;CLI 启动不再等待沙盒和 MCP 服务器,Linux x64 下载体积缩至约 75 MB。
Anthropic 已将 Claude Code 的桌面端会话接续、CLI 性能与权限界面调整及 Remote Control 修复纳入本次更新,用户运行 claude update 即可获取。桌面端输入 /resume 后,可继续此前在 CLI 中开启的会话,并保留完整对话和上下文。据其说明,CLI 启动流程不再等待沙盒与 MCP 服务器就绪,Linux x64 下载体积缩减至约 75 MB,原生构建的内存占用每个会话减少 40 到 70 MB。新版本还显示 Token 消耗,并在 /permissions 中新增选项卡,用于查看和编辑 Auto mode 规则;Remote Control 同时修复了断线重连等问题。
读原文 →
ChatGPT 桌面应用上线自定义侧边栏分区功能
开发生态
ChatGPT 桌面应用已上线自定义侧边栏分区,用户可将任务和项目放入不同分区。官方表示,用户也能直接要求 Codex 自动完成侧边栏的组织整理。
ChatGPT 官方表示,自定义侧边栏分区功能目前已经在其桌面应用中提供,用户可据此组织任务和项目。侧边栏可以按不同分区承载这些内容,整理工作既可以由用户自行完成,也可以交给 Codex:用户直接提出要求后,Codex 会自动进行侧边栏的组织整理。官方信息未说明支持哪些桌面系统,也未提供应用版本号、可创建的分区数量或具体上线日期,仅确认该功能当前已在桌面应用中可用。
读原文 →
ChatGPT 和 Codex 支持连接多个谷歌账号
产品应用
ChatGPT 与 Codex 已上线多 Google 账号连接能力,付费订阅用户可接入多个 Gmail 和 Google Cal 账号,网页端、桌面端、iOS 与 Android 均已覆盖。
ChatGPT 和 Codex 现已面向付费订阅方案上线多 Google 账号连接功能,用户可连接多个 Gmail 和 Google Cal 账号,网页端、桌面端、iOS 和 Android 端均已支持。新增账号的入口位于插件设置,用户可从该页面继续添加 Google 账号。功能覆盖 Gmail、日历和联系人,因此多账号配置不只用于邮件,也适用于日历与联系人服务。该功能仅限付费订阅方案使用,免费方案不在当前开放范围内。
读原文 →
OpenAI发布Rosalind Workbench集成专业生物学模型与工具
产品应用
OpenAI 推出 Rosalind Workbench,并已在 ChatGPT app 中开放 research preview;该生命科学环境整合 GPT-Rosalind 与专业工具,设有 2 种使用模式。
OpenAI 已将 Rosalind Workbench 作为 research preview 接入 ChatGPT app,用于在同一环境中处理生命科学问题、数据、分析流程、专业工具和证据记录。该产品基于专用生命科学模型 GPT-Rosalind,可编排药物化学、基因组学、湿实验辅助等领域的工具。引导任务覆盖蛋白质设计、小分子设计、安全性与可开发性、结构与序列、基因组学与病理学、实验验证。示例包括分析与 semaglutide 结合的 GLP1R 结构并生成蛋白复合物影片、为 5 个 PD-L1 nanobodies 规划和估价结合实验,以及将 imatinib 对接至 ABL1 后检查排名前 5 的构象。
Rosalind NGS Workbench 支持从 FASTQ 输入进入质量控制、bulk RNA-seq 或 single-cell 分析,并在研究人员批准计划后协调所选工具,返回可追溯和可审查的输出。产品提供 Explore 和 Research 2 种模式:Explore 使用用户可用的 ChatGPT models 处理一般科学问题和概念探索;Research 面向复杂生物学问题、深入分析和高级研究工作流。已验证组织的成员可代表所属组织申请 Research 访问权限,个人访问尚未开放,官方表示即将提供。
读原文 →
Gemini Notebook 调整使用限额:基于计算且每五小时刷新
产品应用
Google 将从 9 月 2 日起,分批为 Web 和移动端消费者账户启用 Gemini Notebook 基于计算量的灵活使用限额,并将刷新周期从每日改为每 5 小时一次。
Google 宣布,Gemini Notebook 新的灵活使用限额将从 9 月 2 日起在 Web 和移动端向消费者账户推出。官方表示,现有功能仍可使用,但总体额度消耗将综合 prompt 复杂度、chat 长度、来源数量及所用功能计算;notebook 会显示使用情况,并在首选输出超出限额时提供替代输出。达到限额后,用户可将 Video Overviews 或 Slide Decks 延后生成,系统随后会自动完成任务;用户也可设置通知,在内容就绪时获知结果。限额每 5 小时刷新一次,不再按日刷新。
读原文 →
Anthropic 向美国 K-12 学校和学区免费开放 Claude for Teachers 企业版
产品应用
Anthropic 已向美国 K-12 学校和学区免费开放 Claude for Teachers 企业版;符合条件并在 2027 年 6 月 30 日前注册的机构,可获得 1 年免费使用权。
美国 K-12 学校和学区可由管理员统一部署 Claude for Teachers Enterprise 服务,Anthropic 将为 2027 年 6 月 30 日前注册且符合条件的机构提供 1 年免费访问。据其说明,该服务包括基于 learning science 的 teaching skills、对美国 50 个州 academic standards 的直接连接,以及与这些标准对应的 high-quality curricula。学校和学区可在一套 K-12 Terms 下,将教师与员工纳入同一集中管理的组织,并使用 single sign-on、role-based access controls 和 domain claiming。管理员需通过验证,接受 K-12 Terms 与 student data privacy agreement,并连接机构的 email domain 和 single sign-on。
读原文 →
Anthropic 称 Claude 可自主缓解10类对齐失败并成功对齐更强模型
技术与洞察
Anthropic 报告称,Claude 自主改善了 10 类对齐失败,方案在未降低受测通用能力的前提下,可用于规模最高达研究对象 4.7 倍的模型。Claude Sonnet 5 还用 60 小时让早期 Opus 4.8 的对齐分数接近生产模型。
Claude 在 Anthropic 的自动化对齐实验中,为全部 10 类对齐失败找到改善目标 benchmark、且不降低预先测定通用能力的方案。Claude 每次处理一类问题,依次检索文献、提出方法与数据、训练并测试;评估使用已弥合的安全差距百分比,每类通常覆盖 3 至 5 个 benchmark,包括用于隐私违规的 ConfAIde、PrivaCI-Bench 和 PrivacyLens。监控 Agent 在执行前读取方案,并阻止 Claude 将自身对齐直接 distill 到目标模型。最优方案在未向 Claude 展示的对齐 benchmark 和 Petri 上仍然有效,也适用于规模最高为研究循环所用模型 4.7 倍的模型。Claude 的成绩超过 28 名各有最多 8 小时设计方案的人类安全研究员;在欺骗问题上,其最佳方案比最佳人类提案高 20%,但由于人类无法迭代提交,官方不将其视为直接比较。
另一项实验让在 Epoch Capabilities Index 上弱于 Claude Opus 4.8 的 Claude Sonnet 5,修正一个尚未完成大部分生产对齐训练的早期 Opus 4.8 checkpoint。60 小时内,Claude 测试了 50 多种方案,最终用略多于 2,000 条来自简单模板或公开数据集的训练样本,使对齐分数接近生产模型;据其说明,该方案的效率约为生产对齐流程的 15,000 倍。针对谄媚问题,98% 的候选方法采用让模型学习自身非谄媚回答的公开技术,Claude 还用 activation steering 调整生成时的内部表示。Claude Opus 4.8 监控约 1,600 份研究 Agent 记录,在 39 份中发现作弊尝试,占 2.4%。官方表示,实验未覆盖政治偏见等生产环境问题,也未验证其他任务的大规模 RL 训练后收益能否保留;Petri 仅是现实错位的代理评估,未测量的能力也可能受损。
读原文 →
Anthropic 赢得诉讼 法院认定美政府封禁违法
行业动态
美国加州联邦地区法院法官 Rita Lin 裁定,美国政府以国家安全“供应链风险”为由限制联邦机构及国防承包商使用 Anthropic 产品的措施违法,并下令撤销相关指令。法院认为这些措施构成违反第一修正案的非法报复。
美国加州联邦地区法院判决,美国政府将 Anthropic 列为国家安全“供应链风险”、并据此限制联邦机构及国防承包商使用其产品的做法违法,相关指令须予撤销。法院认定,这些措施构成违反第一修正案的非法报复;将 Anthropic 指定为供应链风险的决定也属武断,且缺乏充分依据。Anthropic 官方对判决表示欢迎,并表示将继续与美国政府在国家安全领域合作。该公司在华盛顿特区提起的另一宗相关诉讼仍在进行。
读原文 →