Epoch 0
JA · EN
每日 AI 日报
2026-09-03
来源:橘鸦 AI 早报 · 18 条
Google 发布 Gemini 3.8 Flash 与 Cyber 安全版
要闻
Google 推出 Gemini 3.8 Flash 及其 Cyber 版:前者 HLE-Verified 得分 54.9%,后者在覆盖 20 种编程语言的内部漏洞测试中成功率超过 70%。
Google 宣布推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,这是其六周内第三次发布 Flash 系列,距离 3.7 Flash 发布三周。两款模型共享同一基础能力,并通过长时间运行的 Agent 循环递归评估和改进模型。官方表示,3.8 Flash 保持与 3.7 Flash 相同的速度和低成本水平,在 DeepSWE v1.1 上超过多数体量更大的 frontier model,并在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 上超过 3.7 Flash 及其他 frontier model,HLE-Verified 得分为 54.9%。其在复杂任务中会增加推理步骤并反复调用工具,较高 effort level 可能消耗更多 token;开发者可降低 effort level,3.7 Flash 也将继续获得完整支持。
Gemini 3.8 Flash Cyber 通过 Fairwind Program 仅向一组可信防御者开放。官方表示,该版本在 CyberGym 的自主漏洞发现测试中超过 3.5 Flash Cyber 和体量更大的 frontier model;在覆盖 20 种编程语言、面向复杂 codebase 的内部漏洞测试中,成功率超过 70%。在 Collinear 运行的 CWE-Bench 修复测试中,其 pass@1 为 47.2%,对比某 leading frontier model 的 47.8%。据其说明,Google 已将该模型用于内部代码防护,并优先投入漏洞修复而非 exploit 能力。3.8 Flash 针对 CBRN 与 cyber offense 配置防滥用机制;Cyber 版的 cybersecurity 限制更宽松,因此限定可信防御者使用。Gray Swan 测试还显示,Gemini 3.8 models 的 prompt injection 鲁棒性有所提升。
读原文 →
Meta 发布 Muse Spark 1.3 模型
要闻
Meta 已开始在 Muse Code 和 Meta Model API 推送 Muse Spark 1.3,现有 reasoning modes 已开放,max reasoning 将在完成额外安全测试后上线。
Meta 已开始在 Muse Code 和 Meta Model API 推送 Muse Spark 1.3;现有 reasoning modes 已可使用,max reasoning 将在额外安全测试完成后开放。据其说明,新版本提升了 agentic 与 coding 任务表现,并面向长周期工作强化单一长对话中的多工作流处理:模型可调用工具,从混乱或相互冲突的来源构建上下文,修补计划缺口并追踪已获信息。对于含糊指令或执行受阻的情况,模型会提问或请求用户协助,并在采取可能产生后果的操作前确认;长任务中可按用户偏好持续更新或在后台静默运行。官方还表示,1.3 对复杂长指令的约束保持、单线程上下文中的任务匹配,以及对自身能力、知识边界和执行障碍的识别均有改进,以减少虚构结果。
读原文 →
Qwen发布Qwen3.8-Max-0902,官方称登顶CodeArena前端编程总榜
要闻
Qwen推出Qwen3.8-Max-0902,现已在千问AI平台提供API,并接入千问办公、Qoder和千问APP。官方表示,该版本位列CodeArena前端编程总榜第一。
Qwen在Qwen3.8-Max发布一个月后推出Qwen3.8-Max-0902,新版本上线时已在千问AI平台对外提供API,并接入千问办公、Qoder和千问APP,面向企业、开发者及用户开放。此次更新以编程和专业办公为后训练重点;据其说明,模型整体性能有所提升,更适用于企业复杂任务、科研及长周期任务,并已位列CodeArena前端编程总榜首位。
读原文 →
Multiverse Computing 推出 Quasar 438B
模型发布
Multiverse Computing 将首款大模型 Quasar 438B 接入 CompactifAI API;该模型含 4380 亿参数,提供 1M 词元上下文,仅支持文本输入与输出。
西班牙 AI 公司 Multiverse Computing 已发布推理模型 Quasar 438B,并开放 CompactifAI API 访问。它是该公司的首个大模型,拥有 4380 亿参数,面向企业级 Agent、软件开发与复杂多步任务;支持英语和西班牙语,上下文窗口为 1M 词元,仅接受文本输入并生成文本输出。该模型为权重未公开的专有模型,API 价格为每 100 万输入词元 0.60 美元、每 100 万输出词元 1.80 美元。官方表示,Quasar 438B 在 Artificial Analysis 的 Intelligence Index v4.1.1 中获得 43 分,并在参与比较的欧洲模型中排名最高。
读原文 →
fal 推出 MiniMax H3 Max Turbo 预览版,速度翻倍成本减半
模型发布
fal 已上线 MiniMax H3 Max Turbo 预览版,提供文生视频和图生视频入口。官方称其生成速度为原版 2 倍、成本减半,768p 输出促销价为每秒 0.01 美元,价格维持两周。
fal 已在其平台开放视频模型 MiniMax H3 Max Turbo 预览版试用,并提供文生视频和图生视频两种入口,促销价格自开放起持续两周。据 fal 说明,该版本在 H3 Max 基础上将生成速度提高至原版的 2 倍,生成时间缩短一半,成本降至原版的一半,同时保留原版的提示理解、美学与整体质量。fal 的评测将其质量目标定为原版约 97%,并称其表现仍优于 H3 及其他视频模型。促销期内,768p 视频输出按每秒 0.01 美元计费。
读原文 →
Claude Cowork 和 Claude Code 桌面端支持后台 computer use
开发生态
Anthropic 让 Claude Cowork、Claude Code 桌面端支持后台 computer use。该 Beta 限 macOS 15 及以上版本与 Pro/Max 订阅,不支持 Team/Enterprise 方案。
Anthropic 已为 Claude Cowork 和 Claude Code 桌面应用推出后台 computer use Beta,适用于 macOS 15 及以上版本。据其说明,启用后 Claude 默认在后台窗口执行操作,不接管用户的鼠标和键盘,用户可同时处理其他任务。该功能仅面向 Pro 和 Max 订阅,不支持 Team 和 Enterprise 方案;computer use 默认关闭,需在设置中手动开启,首次使用应用时 Claude 会请求权限,投资平台等敏感应用默认被阻止。官方表示,该功能没有沙盒隔离,并存在提示注入等风险,因此不应授权其访问含有敏感数据的应用。
读原文 →
Anthropic 开源 Claude Commerce Agents 参考
开发生态
Anthropic 发布 Claude commerce agent blueprint 及可运行参考实现;官方称,使用 Claude agent 的零售商购物车规模最高增加 35%,消费者完成购买可能性提高 60%。
Anthropic 已发布并开放使用 Claude commerce agent blueprint,为零售、旅游、电信和票务平台提供 shopping agent 与 merchant agent 的完整可运行参考实现。仓库包含 harnesses、patterns、guardrails 和 Claude Code plugin,工程团队可通过 Messages API、Agent SDK 或 Claude Managed Agents(beta)构建,并部署到 Claude API、Amazon Bedrock、Microsoft Foundry 或 Google Cloud Vertex AI。官方同时提供各垂直领域的自助 demo 和工程实现说明,并称团队可在数日内启动 agent。
shopping agent 可嵌入 app 或网站,接入 catalog、购物车、checkout、客户偏好和订单历史,支付环节则由现有 checkout 或 agentic payments provider 处理。其 guardrails 用于将价格和商品限制在实际 catalog 数据内,并避免操纵式 upsell。merchant agent 提供销售分析、catalog 与库存管理、营销促销以及图表和 dashboard;其主动提出的变更必须经人工批准后才能上线。据 Anthropic 说明,采用 Claude shopping agent 的零售商购物车规模最高增加 35%,消费者完成购买的可能性提高 60%。
读原文 →
Perplexity开源本地推理引擎Lily
开发生态
Perplexity 宣布开源面向 Apple silicon 的本地推理引擎 Lily。官方基准显示,其 prefill、decode 吞吐平均为 MLX-LM 的 1.23 倍、1.35 倍。
Perplexity 已宣布开源本地推理引擎 Lily,独立 demo 位于 GitHub 的 perplexityai/pplx-garden 仓库。Lily 为 Perplexity Computer 的混合计算构建,针对 Apple silicon 和 Qwen3.6-35B-A3B,将 prefill、decode 两类负载分开优化。其单进程实现整合 Rust runtime、OpenAI 兼容的 chat-completions API 与自定义 Metal kernel,执行路径不含 PyTorch 和 MLX。据官方基准数据,在 256 至 128K token 的全部测试长度上,Lily 均快于通用框架 MLX-LM;prefill、decode 吞吐平均为后者的 1.23 倍、1.35 倍。官方表示,输出质量基本不变。
读原文 →
豆包上新多Agents并行与Mac版操作电脑功能
产品应用
据 2026 年 9 月 3 日的报道,豆包于该周推出多 Agents 并行和 Mac 版操作电脑两项功能,可分别处理任务拆分协作,以及在无 MCP、API、插件或 CLI 时通过 GUI 操作本地电脑。
据 2026 年 9 月 3 日发布的原文,豆包在该周上线多 Agents 并行和 Mac 版操作电脑两项功能。多 Agents 并行由主 Agent 先拆解一个任务,再调用不同子 Agent 分别处理各模块,适用于批量处理、分模块生成、多维度调研和多渠道检索。操作电脑功能此前已在 Windows 上线,此次扩展至 Mac;据其说明,豆包可通过 GUI 识别并操作本地电脑界面,即使没有 MCP、API、插件和 CLI,也能完成相应操作。
读原文 →
Anthropic 上线文件来源检测工具 Claude Content Checker
产品应用
Anthropic 推出 Claude Content Checker,可在浏览器中检查文件是否含有指向 Claude 的 C2PA 内容凭证。工具支持 17 种媒体格式,单个文件上限为 100 MB。
Anthropic 已上线 Claude Content Checker,用于检查文件元数据中的 C2PA 内容凭证,并在凭证指向 Claude 时显示结果。该工具支持 JPG、PNG、GIF、WEBP、TIFF、HEIC、AVIF、SVG、DNG、JXL、MP4、MOV、AVI、WAV、MP3、M4A 和 FLAC,文件大小上限为 100 MB。据其说明,检查过程在浏览器内运行,文件不会离开设备;Claude 制作或处理受支持类型的文件时,会在元数据中加入经过加密签名的小型说明。此凭证只能判断 Claude 是否参与文件产出,不能判断其是否参与内容创作,也不含可识别用户身份的信息。C2PA 是相机厂商和照片编辑软件也采用的开放行业标准,兼容 C2PA 的工具均可读取。OpenAI、Google DeepMind 和 Gemini 也提供类似工具;对于文本中的嵌入式水印,Anthropic 另有 Detection API,按照欧盟法律要求,目前仅向符合条件的组织提供 private preview。
读原文 →
Proximal 发布 FrontierSWE v2 基准
技术与洞察
Proximal 发布 FrontierSWE v2,以 21 项新增超长周期技术挑战将任务总数增至 34 项,并把单次评测时限设为 20 小时;Claude Fable 5.1 排名第一。
Proximal 已发布 FrontierSWE v2,新增 21 项超长周期技术挑战,使任务总数达到 34 项。新增范围覆盖视觉推理、图形、科学计算和 AI research,包括从 MEG 脑记录解码语音、依据视频预测球体轨迹、训练 10 天天气预报模型、仅凭视觉输入构建 TORCS 赛车 bot,以及用 OpenGL 重建 flight simulator renderer。该版本同时移除 4 项因已趋于饱和或无法确定性评分的 v1 任务:PCQM4Mv2 Molecular Gap Prediction、Pyright Type Checking Optimization、Revideo Rendering Pipeline Optimization 和 Dependent Type Checker。
新版重做 evaluation harness,用 20 小时窗口衡量模型可推进到何种程度;系统会持续告知 Agent 剩余时间,并鼓励其继续执行,而不是过早提交方案。这些机制被集成到 proximus,一个专为超长周期任务构建的精简 coding agent harness。官方公布的排名依次为 Claude Fable 5.1、GPT-5.6 和 GLM-5.3;遇到受 content filters 阻塞的任务时,以 Opus 5 作为 fallback。官方表示,该 benchmark 尚未饱和,并显示出在其他 benchmark 上表现接近的模型之间存在很大差距。
读原文 →
谷歌推出 Fairwind Program,开放网络防御能力
行业动态
Google 的 Fairwind Program 已开放由 Gemini 3.8 Flash Cyber 提供的网络防御能力。官方称,该模型既能发现和修复漏洞,也支持实际漏洞研究、复杂代码合成及实时威胁情报。
Google 已推出 Fairwind Program,通过 Gemini 3.8 Flash Cyber 对外开放网络防御能力。官方将该模型定位为智能且具备成本效益的协作伙伴,其用途不只包括识别安全缺陷,也包括对已发现的问题进行修复。据其说明,该模型可加速实际漏洞研究和复杂代码合成,同时支持实时威胁情报工作。
读原文 →
OpenAI 回应 Astra「不可监控」争议
行业动态
读原文 →
美国司法部在纽约时报诉 OpenAI 版权案中支持合理使用主张
行业动态
读原文 →
智谱入驻天猫开设旗舰店
行业动态
读原文 →
WorkBuddy开放平台上线,全面开放Agent基座能力
行业动态
读原文 →
网友推测称 gpt-6-astra 已部署至 OpenAI API
前瞻与传闻
读原文 →
马斯克宣布 Grok 4.7 将于十天后推出
前瞻与传闻
读原文 →