Epoch 0
JA · EN
每日 AI 日报
2026-09-20
来源:橘鸦 AI 早报 · 14 条
DeepSeek API明确节假日及调休周末全天按空闲时段计费
开发生态
使用 DeepSeek 官方 API 时,调休上班的周末和中国法定节假日会被统一归入空闲时段,全天采用相应计费规则;该平台的公告横幅还说明,周末被调为工作日也不会改变归类。
DeepSeek API 平台通过公告横幅明确了官方 API 的计费时段安排:调休上班的周末与中国法定节假日,全天均按空闲时段计费。周末即使因调休安排成为工作日,也继续适用空闲时段标准。该说明覆盖两类日期,一类是因调休需要上班的周末,另一类是中国法定节假日;两类日期的适用范围均为全天,适用对象为 DeepSeek 官方 API 用户。
读原文 →
Tibo疑似暗示Codex banked reset
开发生态
一名用户因 OpenAI 未推出预期更新而要求补上 banked reset,Codex 负责人 Tibo 随后确认此前预告的内容仍将在周二到来,但没有明确承诺是否提供 reset。
Codex 负责人 Tibo 在一名用户发帖要求 OpenAI 提供 banked reset 后作出回应,表示此前预告的内容仍将在周二到来,但没有直接确认 reset。该用户的请求源于 OpenAI 未在其所称的本周推出预期更新。Tibo 的原话是:“OK fine. But it’s also still coming in Tuesday”。部分用户把“OK fine”理解为同意提供 banked reset,另一种解读则认为这不足以构成明确承诺,只能确认先前提到的内容仍按周二的安排到来。由于回复中没有出现“banked reset”,是否会有 reset 仍无法从原话确定。
读原文 →
Step 5 Preview现身Artificial Analysis网站
模型发布
Step 5 Preview 于 2026 年 9 月发布,在 Artificial Analysis Intelligence Index 获得 44 分;支持文本与图像输入,上下文窗口为 100 万 tokens。
Artificial Analysis 的页面显示,Step 5 Preview 于 2026 年 9 月发布,并在 Artificial Analysis Intelligence Index v4.3.2 获得 44 分,同类模型中位数为 24。该次评测生成 160M tokens,同类中位数为 92M;完整评测成本为 922.84 美元。定价为每 100 万 input tokens 1.00 美元、每 100 万 output tokens 2.70 美元,对应中位数分别为 1.88 美元和 10.00 美元。其测得输出速度为 100 tokens/s,同类中位数为 70 tokens/s。
该模型接收文本和图像输入、输出文本,上下文窗口为 1M tokens。页面展示的是 reasoning 版本,并称 non-reasoning 变体也可能存在。上述指标均与同类模型比较;速度数据来自 first-party API,若没有 first-party API,则取不同提供方的中位数。Intelligence Index v4.3.2 由 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1 构成。
读原文 →
千问发布Qwen3.8-LiveTranslate
模型发布
千问推出 Qwen3.8-LiveTranslate,为真实对话提供 60 种语言的实时翻译;据其数据,字均延迟从上一代的 2.8 秒降至 2.3 秒。模型现可在线体验,API 已上线千问 AI 平台。
Qwen3.8-LiveTranslate 现已正式发布,这是千问面向真实对话推出的同声传译大模型,支持 60 种语言;在线体验已经开放,API 也已上线千问 AI 平台。据千问说明,模型采用 Interleave 架构,将音频与文本编排为交织的单一流,并通过缓存复用已经接收的音频和已经生成的译文,使字均延迟由上一代的 2.8 秒降至 2.3 秒。新增能力包括实时说话人分离、原文与译文同帧输出,以及利用长上下文进行消歧。据千问公布的评测结果,该模型在多说话人长音频和多语言实时同传测试中均优于上一代及当前主流系统。
读原文 →
阿里巴巴达摩院开源腹部CT诊断模型RADAR,论文发表于Science
模型发布
阿里巴巴达摩院开源腹部 CT 视觉语言模型 RADAR,相关论文发表于 Science。项目说明称,该模型使用超过 400,000 例增强腹部 CT 和 1,500 万组解剖感知图文对训练,不依赖人工标注。
阿里巴巴达摩院已在 GitHub 开源通用腹部 CT 视觉语言模型 RADAR,相关论文发表于 Science,项目代码采用 Apache License 2.0。据项目说明,RADAR 直接从临床报告学习,以超过 400,000 例增强腹部 CT 检查和 1,500 万组解剖感知图文对完成训练,无需人工标注。官方表示,该模型覆盖放射学 AI 的常规及复杂临床任务,并在两类任务中达到专家水平。仓库提供 conda 环境、依赖项及详细指南,代码也可在 Zenodo 归档;部分代码来自采用各自许可证的第三方开源项目,原始许可证文本保存在 THIRD_PARTY_LICENSES.md。
读原文 →
Cua开源小型表单填写模型cua-s1-forms
模型发布
Cua 开源了用于 GUI 表单填写的 cua-s1-forms,以单次 forward pass 并行评估各 UI 元素的候选操作。官方同任务对比中,该模型总体为 99.7%,托管版 Jev API 为 83.6%。
Cua 已开源 cua-s1-forms,作为 cua-driver 背后的 GUI 表单填写决策层使用。该模型不生成文本,而是为单个 UI 元素及其类型化候选项执行一次 forward pass,输出每个选项的概率;上下文截断至 224 bytes,每个选项截断至 96 bytes,候选项包括按文档实体生成的 fill 操作,以及固定的 check、click 和 skip。表单内所有可操作元素会在一个 batch 中独立并行评分,下游 executor 取 argmax,并按 fill、checkbox、单次 submit click 的顺序,经 set_value 或 click 交给 cua-driver 执行。官方表示,在与零 fine-tuning 的托管 Jev API(jev-latest)进行同任务对比时,cua-s1-forms 总体为 99.7%,Jev 为 83.6%;Jev 在 fill、check、click 判断上为 96%,在识别已填写字段应 no-op 上为 74%。据其说明,后一个约定被用于训练 cua-s1-forms,但未用于训练托管 Jev。项目仓库同时提供完整说明、训练代码、合成数据生成器、Cua Driver 集成,以及 snapshot → score → order → execute 的实现。
读原文 →
中国电信开源Xing4.0-29B-A4B模型
模型发布
中国电信开源 Xing4.0-29B-A4B,模型含 29B 参数、每个 token 激活 4B,原生 context length 为 256K,可扩至 512K。官方称其全程使用 Ascend NPU 和 MindSpore 训练。
中国电信人工智能科技有限公司已将 Xing4.0-29B-A4B 开源;其总参数量为 29B,每个 token 激活 4B,原生 context length 为 256K,并可扩展至 512K。官方表示,该模型全程在 Ascend NPU 平台上使用 MindSpore 训练,是这一规模下首个采用该训练方式的模型。项目公布的 Coding Agent 评测分数包括 SWE-bench Verified 75.0、SWE-bench Multilingual 66.0、Terminal-Bench 2.1 57.5;General Agent 评测中,Claw-Eval 为 76.55、DeepresearchBII 为 60.80、Tau3-Bench 为 64.63。
项目已分别向 vLLM、SGLang 和 KTransformers 提交 Xing4.0 支持 PR,但仍在审核且尚未合入各自主分支,合入前需要从对应 PR 分支安装。vLLM 与 SGLang 启动后均通过 http://localhost:8000/v1 提供 OpenAI-compatible API。模型可通过 LLaMA-Factory 进行 fine-tuning、权重合并、推理和部署,也已适配 Ascend Atlas 800T A3 集群,可使用 MindSpore + MindFormers 执行分布式训练与评测;项目还通过 FlagOS 将 mHC Triton-Ascend fused operators 集成进 MindFormers,并完成单节点 16 卡训练验证。
读原文 →
Android Developers推出Android Bench 2.0
技术与洞察
Android Developers 推出 Android Bench 2.0,用于评估 AI 完成真实、跨多日 Android 工程任务的表现,并加入常用 Agent 与模型组合测试及 6 个新模型。
Android Developers 已推出 Android Bench 2.0,更新后的评测方法与模型比较结果现已开放查看。该基准覆盖从零构建应用、开发新功能,以及把跨平台代码库迁移至 Android 等真实、跨多日的工程任务,并按照完成率、视觉保真度、回归问题,以及各模型执行各项任务的平均成本进行连续评分。2.0 版还开始评估常用 Agent 与对应模型的组合,新增 Gemini 3.8 Flash、Gemini 3.7 Flash、GPT-6 Astra、Fable 5.1、Kimi K3 和 Qwen 3.8 Max。
读原文 →
OpenAI等四家公司遭付费用户提起反垄断诉讼
行业动态
付费用户于 2026 年 9 月 18 日起诉 Anthropic、OpenAI、SpaceXAI 和 Google,指控四家公司合谋放慢 AI 产品改进,导致订阅者按原价获得更慢更新,并要求法院制止相关安排。
付费用户于 2026 年 9 月 18 日在美国加利福尼亚北区联邦地区法院起诉 Anthropic PBC、OpenAI OPCO LLC、SpaceXAI 和 Google LLC,指控四家公司达成限制 AI 开发速度的协议,涉嫌违反 Sherman Antitrust Act 第 1 条。案件名为 Buist v. Anthropic PBC,案号为 3:26-cv-10693。诉状称,竞争者共同决定产品改进速度构成限制竞争,订阅用户因此继续支付相同价格,却获得比正常竞争下更慢的产品改进。
据诉状所述,争议始于 Anthropic CEO Dario Amodei 发表题为《We Must Pace the Frontier》的文章并呼吁全行业协调;随后 SpaceXAI 创始人 Elon Musk 表示支持,OpenAI CEO Sam Altman 也予以赞同,Google DeepMind 联合创始人 Demis Hassabis 称其为正确方向。原告将此描述为限制产出的 cartel,并申请集体诉讼认证、禁令及确认四家公司违反联邦反垄断法的宣告性判决。原告由 Trial Lawyers for Justice 代理;四家被告均未立即回应置评请求。
读原文 →
Anthropic 或将发布发布新模型应对Astra在企业市场的竞争
前瞻与传闻
路透社援引 3 名消息人士称,Anthropic 正考虑推出新模型,以回应 OpenAI GPT-6 Astra 在企业市场获得的关注,但是否发布及发布时间仍未确定。爆料博主 leo 还称 3 款 Claude 模型正在测试,此说法尚未获官方确认。
2026 年 9 月 19 日,路透社援引 3 名消息人士报道称,Anthropic 正在考虑发布一款新模型,以应对 OpenAI GPT-6 Astra 在企业市场获得的关注,但尚未决定是否发布以及何时发布。报道称,公司仍在评估下一款模型的安全性,并在利率上升、竞争加剧和预期 IPO 的背景下权衡模型投入与盈利能力。爆料博主 leo 另称,新版 Fable、Opus 和 Sonnet 正在不同 Claude 界面及账号中进行隐蔽测试;这一说法未获 Anthropic 确认,也不代表 3 款模型已全面开放。
读原文 →
OpenAI 或将发布 GPT-6 Sol 和 GPT-6 Luna
前瞻与传闻
OpenAI 团队成员 Tibo 表示,部分新内容计划于下周公布,更多内容将在未来数月推出;GPT-6 Sol 与 GPT-6 Luna 仅源于用户提议,官方尚未确认。
OpenAI 团队成员 Tibo 表示,团队计划在下周先公布部分新内容,并在未来数月继续展示其余内容,但 OpenAI 尚未确认 GPT-6 Sol 或 GPT-6 Luna 的存在与发布时间。Sam Altman 此前称,原定发布且由其最期待的内容已推迟到下周。Tibo 还说,他正与 Sam Altman 等人筹备主题演讲;由于待展示项目较多,团队需要说明这些内容如何组合。据其说明,现有内容约可支撑三场开发者活动。Tibo 随后向社区询问还希望看到什么,一名用户提出优先发布 GPT-6 Sol 和 GPT-6 Luna,Tibo 回复“What else do you want”,由此引出相关猜测。OpenAI DevDay 定于当地时间 9 月 29 日举行,原文未注明年份。
读原文 →
Google 或将发布 Gemini 4 Pro
前瞻与传闻
多名第三方测试者和平台称,Google 正在 Arena 以其他模型名称隐藏测试 Gemini 4 Pro,任务涉及代码生成和图像处理;Google 尚未确认型号、成绩、价格及开放时间。
多名第三方测试者和平台此前称,Google 正在 Arena 以其他模型名称隐藏测试 Gemini 4 Pro,但 Google 尚未确认这一说法,也未公布公开开放时间。相关测试者和平台称,该模型在代码生成和图像任务中表现优异。与此同时,一张与基准测试相关的图片曾在外部流传,该图片已被鉴定为使用 GPT-Image 生成。对于 Gemini 4 Pro 的具体型号、内部代号、测试成绩和价格,Google 目前同样没有确认。
读原文 →
MiniMax 或将发布 MiniMax-M3.1
前瞻与传闻
MiniMax 开源的 MiniMax Code CLI 多处出现 MiniMax-M3.1,测试配置最高为 1,000,000 上下文和 128,000 输出;模型尚未实际内置,官方暂无更多信息。
MiniMax-M3.1 的名称已出现在 MiniMax 官方开源的 MiniMax Code CLI 多个文件中,但该模型目前尚未成为实际内置模型,官方也没有披露更多信息。相关代码分布于历史模型字段恢复、managed catalog、模型列表、参数解析和队列持久化等位置。测试配置列出 450,000、512,000 和 1,000,000 三种上下文数值,以及 8,192、16,000 和 128,000 三种输出数值,并涉及多个 thinking effort 档位。社区流传的另一张截图显示,一名官方工作人员预告该模型即将发布,但目前没有更多官方发布细节。
读原文 →
月之暗面或将发布 Kimi K3.1
前瞻与传闻
Kimi 知乎认证机构号曾发布一串从“4159”开始、缺少开头“3.1”的圆周率数字,随后删除该动态。外界据此猜测 Kimi K3.1 可能发布,但帖子未直接提及该版本,也未给出发布时间。
Kimi 知乎认证机构号曾以一串缺少开头“3.1”的圆周率数字引发 Kimi K3.1 将发布的猜测,但帖子没有确认该产品,且目前已被删除。该串数字从“4159”开始,缺失部分与“K3.1”的版本编号对应,因此被解读为可能的发布暗示。帖子本身未直接提及 Kimi K3.1,也未说明发布时间、产品能力、开放范围或使用方式。相关猜测尚未得到进一步确认。
读原文 →