每日 AI 日报
2026-09-21
来源:橘鸦 AI 早报 · 8 条
Qwen开源图形生成与编辑模型Qwen-Image-2.1
要闻
Qwen 发布并开放 Qwen-Image-2.1 模型权重,将文生图与图像编辑整合进同一模型;其视觉生成模块采用 7B 参数、32 层 Single-Stream DiT,并支持最多 10 张参考图。
Qwen 在发布 Qwen-Image-2.1 时同步开放模型权重,并以同一模型承载文生图和图像编辑。视觉生成模块采用 7B 参数、32 层 Single-Stream DiT;据其说明,新版使用混合粒度注意力和 KV Cache 复用,以减少多图输入的重复计算。它可生成、编辑 RGBA 透明图,也可从普通照片提取主体形成透明图层;编辑最多接收 10 张参考图,并提供圈选、涂抹和独立掩码等局部控制。官方表示,模型增强了人像身份以及商品文字、纹理和形态的一致性,也改进了文字排版、人物光影与细节,并覆盖全景图、信息图和分镜生成。Diffusers、ComfyUI、vLLM-Omni、SGLang 和 LightX2V 均在发布当天提供支持。
读原文 →
阶跃发布 Step 5 Preview,目前已全量开放
要闻
阶跃星辰已全量开放面向真实世界 Agentic 任务的 Step 5 Preview;该模型采用 600B 总参数、27B 激活参数的稀疏 MoE 架构,并支持 100 万 Token 上下文窗口。
阶跃星辰正式发布面向真实世界 Agentic 任务的旗舰基座模型 Step 5 Preview,模型现已全量开放。其应用范围包括 AI 编程、软件工程、专业知识工作和金融。据其说明,该模型使用稀疏 MoE 架构,拥有 600B 总参数和 27B 激活参数,可接收文本与视觉输入,支持 100 万 Token 上下文窗口,面向长上下文、多轮工具调用和持续执行任务。官方表示,Step 5 Preview 在 Artificial Analysis Intelligence Index 得分为 44,排名全球开源模型前三,单任务成本为 Claude Opus 5 的八分之一。用户可通过国内外开放平台 API、Studio 在线体验或订阅 Step Plan 使用;模型权重计划于 10 月 15 日开放。
读原文 →
TypeSafe AI向所有用户开放Jev,新用户获赠5美元额度
开发生态
TypeSafe AI 已通过在线控制台向所有用户开放 Jev,并取消候补名单限制,用户无需等待即可开始使用。每位用户均可获得 5 美元初始额度,官方称约可支持 1.2 亿 token。
TypeSafe AI 目前已在其在线控制台向全部用户开放 Jev,访问调整现已生效,使用者不再需要先加入候补名单。开放后,用户可以直接通过控制台开始使用 Jev,此前设置的访问等待限制已被取消。这次开放面向所有用户,不再以候补名单作为访问门槛。额度方面,所有用户均可获得 5 美元初始额度;据 TypeSafe AI 说明,这笔额度约可支持 1.2 亿 token。
读原文 →
Google开源Agentic编排器AX,支持有状态任务暂停与恢复
开发生态
Google 开源了面向 Kubernetes 集群的 Agentic 编排器 AX,可声明式运行每集群数十亿个自主 Agent 任务,并支持有状态任务暂停与恢复;项目目前采用 v1alpha1 规格,稳定版前可能出现重大 breaking changes。
Google 已将 AX 以 Apache License 2.0 开源,作为运行在 Kubernetes 集群上的声明式 Agentic 编排器,用于隔离执行并管理可暂停、恢复的有状态 Agent 任务。AX 构建于 Agent Substrate 之上,通过 workspace 与 gateway 规格配置任务,负责接入 workspace、限制网络,并以 ax.io/v1alpha1 manifest 统一描述资源。官方表示,每个集群可运行数十亿个自主 Agent 工作负载;项目仍在调整核心概念、协议与规格,稳定版发布前可能引入重大 breaking changes。
CLI ax 通过 gRPC 连接 control plane,命令形态参照 kubectl,包含 apply、get、describe、watch、delete 及少量 Agent 专用操作;它会跟随当前 Kubernetes context,并在后台解析和建立通往对应集群 control plane 的 tunnel。部署要求包括 Kubernetes cluster、ko、集群可拉取的 container registry,以及可访问的 Agent Substrate Control API,集群内默认地址为 api.ate-system.svc.cluster.local:443。部署流程先部署 Redis,再用 ko 构建并部署 control plane images,所有资源进入 ax-system namespace。./demo.sh 可依次应用自定义 workspace、等待其就绪、通过 ax ssh 执行命令并暂停任务。
读原文 →
腾讯开源端到端文档解析模型WeVisDoc
模型发布
腾讯已将 WeVisDoc 发布至 GitHub 和 Hugging Face,开放 2B、4B 权重及代码、教程;该模型可把不同版式与采集条件下的页面图像直接转成结构化 Markdown。
腾讯已在 GitHub 和 Hugging Face 公开 WeVisDoc 的 2B、4B 权重、配套代码与教程,该端到端文档解析模型用于将不同版式和采集条件下的页面图像直接转换为结构化 Markdown。两个版本分别由 Qwen3-VL-2B-Instruct 和 Qwen3-VL-4B-Instruct 微调而来,可在同一输出序列中保留文本、LaTeX 公式、HTML 表格及阅读顺序。据其说明,WeVisDoc-4B 在 OmniDocBench v1.6,以及 PureDocBench 的 Clean、Digital Degraded 和 Real Degraded 共四项设置中,均领先所比较的端到端解析模型。
读原文 →
WebCraftBench以真实交互和代码覆盖率评估AI网页应用
技术与洞察
arXiv 页面标题称 WebCraftBench 以真实交互和代码覆盖率评估 AI 网页应用;所给正文仅介绍 arXivLabs 框架及其四项合作价值观,未提供该基准的版本、数据或评测结果。
所给 arXiv 页面标题将 WebCraftBench 描述为一种通过真实交互和代码覆盖率评估 AI 网页应用的方法,但正文没有给出其作者、发布日期、版本号、数据集规模、指标定义或实验结果。正文实际介绍的是 arXivLabs:该框架允许协作者直接在 arXiv 网站上开发并分享新功能。据其说明,与 arXivLabs 合作的个人和组织接受开放、社区、卓越和用户数据隐私四项价值观;arXiv 仅与遵循这些价值观的伙伴合作,并邀请可为 arXiv 社区增加价值的项目构想进一步了解 arXivLabs。
读原文 →
硅基流动完成B+轮二期和C轮融资
行业动态
硅基流动宣布完成B+轮二期及C轮融资,2026年度累计股权融资额近29亿元。资金将投向推理引擎、异构算力调度及模型与芯片适配研发,并用于全球市场拓展。
硅基流动已宣布完成B+轮二期和C轮融资,其2026年度累计股权融资额近29亿元。参与本次融资的机构包括中国互联网投资基金、国新基金和中国移动链长基金,部分既有股东也进行了追加投资。据其说明,募集资金将增加对推理引擎、异构算力调度以及模型与芯片适配的研发投入,用于强化Token供应平台,并进一步拓展全球市场。
读原文 →
智谱MaaS平台将上线数据内容不留存功能
行业动态
智谱MaaS平台将上线数据内容不留存功能,所有用户均可申请;生效后,输入与输出仅用于当次模型调用。Batch API、File API不在覆盖范围内,法律法规要求或违规、滥用核查场景下,相关数据可能留存30天及以上。
智谱MaaS平台将上线数据内容不留存功能,具体生效时间和适用范围以平台确认结果为准。所有用户均可申请,企业和开发者可通过MaaS控制台提交申请;据其说明,功能生效后,平台不会静态存储用户的输入与输出,相关数据仅用于完成当次模型调用。Batch API、File API等需要持久化保存任务或文件的功能不在覆盖范围内。因法律法规要求,或为核查涉嫌违规、滥用行为,平台仍可能将相关数据留存30天及以上。
读原文 →