デイリー AI ニュース

2026-09-03

出典:橘鸦 AI 早报 · 18 件

2026-09-03
2026-09-03 2026-09-02 2026-09-01 2026-08-31 2026-08-30 2026-08-29 2026-08-28 2026-08-27 2026-08-26 2026-08-25 2026-08-24 2026-08-23

Google、Gemini 3.8 FlashとCyberセキュリティ版を発表

要闻

Google、Gemini 3.8 FlashとCyberセキュリティ版を発表

Google は Gemini 3.8 Flash とその Cyber 版を発表した。前者は HLE-Verified で 54.9%を記録し、後者は20のプログラミング言語を対象とする社内脆弱性テストで成功率70%超を記録した。

Google は Gemini 3.8 Flash と Gemini 3.8 Flash Cyber を発表した。Flash シリーズのリリースは6週間で3回目となり、3.7 Flash のリリースから3週間後にあたる。両モデルは同じ基盤能力を共有し、長時間稼働する Agent ループを通じてモデルを再帰的に評価、改善する。公式によると、3.8 Flash は 3.7 Flash と同じ速度と低コスト水準を維持し、DeepSWE v1.1 では大規模な frontier model の多くを上回った。Vals Finance Agent V2 と Harvey's Legal Agent Benchmark では 3.7 Flash および他の frontier model を上回り、HLE-Verified のスコアは54.9%だった。複雑なタスクでは推論ステップを増やしてツールを繰り返し呼び出すため、高い effort level では token 消費量が増える場合がある。開発者は effort level を下げることができ、3.7 Flash も引き続き完全にサポートされる。

Gemini 3.8 Flash Cyber は Fairwind Program を通じ、選定された信頼できる防御担当者にのみ提供される。公式によると、同モデルは CyberGym の自律型脆弱性発見テストで 3.5 Flash Cyber と大規模な frontier model を上回った。20のプログラミング言語と複雑な codebase を対象とする社内脆弱性テストでは、成功率が70%を超えた。Collinear が運営する CWE-Bench の修正テストでは pass@1 が47.2%で、ある leading frontier model の47.8%と比較された。Google は同モデルを社内コードの保護に使用しており、exploit 能力より脆弱性修正を優先してきたと説明している。3.8 Flash は CBRN と cyber offense の悪用防止策を備える一方、Cyber 版は cybersecurity に関する制限がより緩いため、利用者を信頼できる防御担当者に限定する。Gray Swan のテストでは、Gemini 3.8 models の prompt injection に対する堅牢性も向上した。

原文を読む →

Meta、Muse Spark 1.3モデルを発表

要闻

Meta、Muse Spark 1.3モデルを発表

Meta は Muse Code と Meta Model API で Muse Spark 1.3 の提供を開始した。既存の reasoning modes は利用可能で、max reasoning は追加の安全性テスト完了後に公開される。

Meta は Muse Code と Meta Model API で Muse Spark 1.3 の提供を開始した。既存の reasoning modes はすでに利用でき、max reasoning は追加の安全性テスト完了後に公開される。同社の説明によると、新バージョンは agentic および coding タスクの性能を高め、長期的な作業に向けて、単一の長いスレッド内で複数のワークフローを扱う能力を強化した。モデルはツールを使用し、整理されていない情報源や相互に矛盾する情報源からコンテキストを構築し、計画の不足を修正しながら、得た情報を追跡できる。指示が曖昧な場合や処理が行き詰まった場合は質問やユーザーへの支援要請を行い、結果に影響する操作の前には確認する。長いタスクでは、ユーザーの好みに応じて継続的に進捗を伝えるか、バックグラウンドで静かに処理する。公式はさらに、1.3 では複雑で長い指示の制約維持、単一スレッドのコンテキストにおけるタスクの対応付け、自身の能力や知識の限界、処理上の障害の認識も改善し、架空の結果を生成しにくくしたと説明している。

原文を読む →

Qwen、Qwen3.8-Max-0902を発表、CodeArenaのフロントエンドプログラミング総合ランキングで首位と説明

要闻

Qwen、Qwen3.8-Max-0902を発表、CodeArenaのフロントエンドプログラミング総合ランキングで首位と説明

QwenはQwen3.8-Max-0902を公開し、千問AIプラットフォームでAPIの提供を開始するとともに、千問办公、Qoder、千問APPにも導入した。公式によると、同バージョンはCodeArenaのフロントエンド・プログラミング総合ランキングで1位となった。

QwenはQwen3.8-Maxの公開から1か月後にQwen3.8-Max-0902をリリースし、新バージョンの公開時点で千問AIプラットフォームを通じたAPI提供を開始したほか、千問办公、Qoder、千問APPにも導入し、企業、開発者、ユーザー向けに提供している。今回の更新では、プログラミングと専門業務を重点にpost-trainingを実施した。据其説明によると、モデルの総合性能が向上し、企業の複雑なタスク、研究、長期タスクへの適性が高まったほか、CodeArenaのフロントエンド・プログラミング総合ランキングで首位となった。

原文を読む →

Multiverse Computing、Quasar 438Bを発表

模型发布

Multiverse Computing、Quasar 438Bを発表

Multiverse Computingは、同社初の大規模モデルQuasar 438BをCompactifAI APIに接続した。4380億パラメータと1Mトークンのコンテキストを備え、テキストの入出力のみに対応する。

スペインのAI企業Multiverse Computingは、推論モデルQuasar 438Bを公開し、CompactifAI API経由でのアクセス提供を開始した。同社初の大規模モデルで、4380億パラメータを持ち、企業向けAgent、ソフトウェア開発、複雑な複数ステップのタスクを対象とする。英語とスペイン語に対応し、コンテキストウィンドウは1Mトークンで、テキスト入力とテキスト出力のみを扱う。ウェイト非公開のプロプライエタリモデルで、API価格は入力100万トークン当たり0.60ドル、出力100万トークン当たり1.80ドル。公式発表によると、Quasar 438BはArtificial AnalysisのIntelligence Index v4.1.1で43点を獲得し、比較対象となった欧州モデルの中で首位だった。

原文を読む →

fal、速度2倍・コスト半減のMiniMax H3 Max Turboプレビュー版を発表

模型发布

fal、速度2倍・コスト半減のMiniMax H3 Max Turboプレビュー版を発表

fal は MiniMax H3 Max Turbo のプレビュー版を公開し、text-to-video と image-to-video の入口を提供した。公式によると、生成速度は従来版の 2 倍、コストは半分で、768p 出力のプロモーション価格は 1 秒あたり 0.01 ドルとなり、2 週間継続する。

fal は動画モデル MiniMax H3 Max Turbo のプレビュー版を同社プラットフォームで試用可能にし、text-to-video と image-to-video の 2 種類の入口を提供した。プロモーション価格は公開時から 2 週間適用される。fal の説明によると、このバージョンは H3 Max を基に、生成速度を従来版の 2 倍にし、生成時間とコストをそれぞれ半分にする一方、従来版のプロンプト理解、美的表現、全体的な品質を維持する。fal の評価では品質目標を従来版の約 97% としており、H3 および他の動画モデルを引き続き上回るとしている。プロモーション期間中、768p の動画出力は 1 秒あたり 0.01 ドルで課金される。

原文を読む →

Claude CoworkとClaude Codeのデスクトップ版、バックグラウンドでのcomputer useに対応

开发生态

Claude CoworkとClaude Codeのデスクトップ版、バックグラウンドでのcomputer useに対応

Anthropicは、Claude CoworkとClaude Codeのデスクトップ版でバックグラウンドcomputer useを利用可能にした。このBetaはmacOS 15以降とProまたはMaxの契約が必要で、TeamとEnterpriseには対応しない。

Anthropicは、macOS 15以降に対応するバックグラウンドcomputer useのBetaを、Claude CoworkとClaude Codeのデスクトップアプリに導入した。同社の説明によると、有効化するとClaudeはデフォルトでバックグラウンドウィンドウ内の操作を実行し、ユーザーのマウスやキーボードを占有しないため、ユーザーは別の作業を同時に進められる。この機能はProとMaxの契約者のみが利用でき、TeamとEnterpriseには対応しない。computer useはデフォルトで無効になっており、設定から手動で有効化する必要がある。アプリを初めて使用する際にはClaudeが権限を要求し、投資プラットフォームなど一部の機密性が高いアプリはデフォルトでブロックされる。公式は、この機能にはサンドボックスによる隔離がなく、prompt injectionなどのリスクがあるため、機密データを含むアプリへのアクセスを許可すべきではないとしている。

原文を読む →

Anthropic、Claude Commerce Agentsのリファレンス実装をオープンソース化

开发生态

Anthropic、Claude Commerce Agentsのリファレンス実装をオープンソース化

Anthropic は Claude commerce agent blueprint と実行可能なリファレンス実装を公開した。公式によると、Claude agent を利用する小売事業者ではカート規模が最大 35% 増え、購入完了の可能性が 60% 高まった。

Anthropic は Claude commerce agent blueprint を公開し、利用可能にした。小売、旅行、通信、チケット販売プラットフォーム向けに、shopping agent と merchant agent の完全に動作するリファレンス実装を提供する。repository には harnesses、patterns、guardrails、Claude Code plugin が含まれ、エンジニアリングチームは Messages API、Agent SDK、Claude Managed Agents(beta)を使って構築し、Claude API、Amazon Bedrock、Microsoft Foundry、Google Cloud Vertex AI にデプロイできる。公式は各分野のセルフガイド demo と実装解説も提供し、数日で agent を稼働させられるとしている。

shopping agent は app や Web サイトに組み込み、catalog、カート、checkout、顧客の好み、注文履歴と連携できる。支払いは既存の checkout または agentic payments provider が処理する。guardrails は価格と商品を実際の catalog データに制限し、操作的な upsell を避けるために使われる。merchant agent は販売分析、catalog と在庫の管理、マーケティングとプロモーション、チャートや dashboard を提供する。merchant agent が能動的に提案した変更は、公開前に人の承認を必要とする。Anthropic の説明によると、Claude shopping agent を導入した小売事業者ではカート規模が最大 35% 増え、消費者が購入を完了する可能性が 60% 高まった。

原文を読む →

Perplexity、ローカル推論エンジンLilyをオープンソース化

开发生态

Perplexity、ローカル推論エンジンLilyをオープンソース化

Perplexityは、Apple silicon向けのローカル推論エンジンLilyをオープンソース化すると発表した。公式ベンチマークでは、prefillとdecodeの平均スループットはMLX-LMの1.23倍と1.35倍だった。

Perplexityはローカル推論エンジンLilyのオープンソース化を発表し、単体demoをGitHubのperplexityai/pplx-gardenリポジトリで公開している。LilyはPerplexity Computerのハイブリッドコンピューティング向けに構築され、Apple siliconとQwen3.6-35B-A3Bに特化し、prefillとdecodeを別々のワークロードとして最適化している。単一プロセスの実装にはRust runtime、OpenAI互換のchat-completions API、独自のMetal kernelが統合され、実行パスにPyTorchとMLXは含まれない。公式ベンチマークデータによると、Lilyは256から128K tokenまでのすべての測定対象の長さで汎用フレームワークMLX-LMを上回り、prefillとdecodeの平均スループットはそれぞれ1.23倍と1.35倍だった。公式は、出力品質は基本的に変わらないとしている。

原文を読む →

豆包、複数Agentsの並列実行とMac版のPC操作機能を追加

产品应用

2026 年 9 月 3 日付の報道によると、豆包は同週、複数 Agents の並列実行と Mac 版のコンピューター操作機能を公開した。タスクの分割と連携処理に加え、MCP、API、プラグイン、CLI がなくても GUI 経由でローカルコンピューターを操作できる。

2026 年 9 月 3 日に公開された原文によると、豆包は同週、複数 Agents の並列実行と Mac 版のコンピューター操作という 2 つの機能を追加した。複数 Agents の並列実行では、メイン Agent が最初に 1 つのタスクを分解し、異なるサブ Agent を呼び出して各モジュールを個別に処理する。バッチ処理、モジュール別の生成、多角的な調査、複数チャネルでの検索に対応する。コンピューター操作機能は以前から Windows で提供されており、今回 Mac にも拡大した。同社の説明では、豆包は GUI を通じてローカルコンピューターの画面を認識して操作でき、MCP、API、プラグイン、CLI がなくても該当する操作を実行できる。

原文を読む →

Anthropic、ファイルの出所を検出するClaude Content Checkerを公開

产品应用

Anthropic、ファイルの出所を検出するClaude Content Checkerを公開

AnthropicはClaude Content Checkerを公開し、ファイルにClaudeを示すC2PAコンテンツクレデンシャルが含まれるかをブラウザ上で確認できるようにした。17種類のメディア形式に対応し、1ファイルの上限は100 MBとなる。

AnthropicはClaude Content Checkerを公開し、ファイルのメタデータにあるC2PAコンテンツクレデンシャルを検査して、それがClaudeを示す場合に結果を表示するようにした。対応形式はJPG、PNG、GIF、WEBP、TIFF、HEIC、AVIF、SVG、DNG、JXL、MP4、MOV、AVI、WAV、MP3、M4A、FLACで、ファイルサイズの上限は100 MBとなる。同社の説明によると、検査はブラウザ内で実行され、ファイルが端末外に送信されることはない。Claudeが対応形式のファイルを作成または処理する際は、暗号署名された短い注記がメタデータに追加される。このクレデンシャルで判定できるのはClaudeがファイルの生成に関与したかどうかに限られ、コンテンツの作成への関与は判定できず、ユーザーを特定できる情報も含まれない。C2PAはカメラメーカーや写真編集ソフトウェアでも使われるオープンな業界標準で、C2PA対応ツールで読み取れる。OpenAI、Google DeepMind、Geminiも同様のツールを提供している。テキストに埋め込まれたウォーターマークについては、Anthropicが別途Detection APIを用意しており、EU法の要件に基づき、現在は条件を満たす組織だけにprivate previewとして提供している。

原文を読む →

Proximal、FrontierSWE v2ベンチマークを発表

技术与洞察

Proximal、FrontierSWE v2ベンチマークを発表

ProximalはFrontierSWE v2を公開し、超長期の技術課題を21件追加して総数を34件とし、1回の評価時間を20時間に設定した。首位はClaude Fable 5.1だった。

ProximalはFrontierSWE v2を公開し、超長期の技術課題を21件追加して、タスク総数を34件とした。追加範囲は視覚推論、グラフィックス、科学計算、AI researchに及び、MEG脳記録からの音声解読、動画に基づくボール軌道予測、10日間の天気予報モデルの訓練、視覚入力だけを使うTORCSレーシングbotの構築、OpenGLによるflight simulator rendererの再構築などを含む。同時に、飽和状態に達したか、決定論的に採点できなかったv1の4タスク、PCQM4Mv2 Molecular Gap Prediction、Pyright Type Checking Optimization、Revideo Rendering Pipeline Optimization、Dependent Type Checkerを削除した。

新版ではevaluation harnessを刷新し、20時間の枠内でモデルがどこまで進めるかを測定する。システムはAgentに残り時間を継続的に知らせ、早期に解答を提出せず実行を続けるよう促す。これらの仕組みは、超長期タスク専用の簡素なcoding agent harnessであるproximusに組み込まれた。公式発表の順位はClaude Fable 5.1、GPT-5.6、GLM-5.3の順で、content filtersに阻まれたタスクではOpus 5をfallbackとして使用する。公式は、このbenchmarkはまだ飽和しておらず、他のbenchmarkでは成績が近いモデル間にも大きな差が示されたとしている。

原文を読む →

Google、ネットワーク防御能力を開放するFairwind Programを発表

行业动态

Google、ネットワーク防御能力を開放するFairwind Programを発表

GoogleのFairwind Programは、Gemini 3.8 Flash Cyberが提供するサイバー防御機能を外部に開放した。公式によると、このモデルは脆弱性の発見と修正に対応し、実践的な脆弱性研究、複雑なコード合成、リアルタイムの脅威インテリジェンスも支援する。

GoogleはFairwind Programを開始し、Gemini 3.8 Flash Cyberを通じてサイバー防御機能を外部に開放した。公式は同モデルを、知的でコスト効率に優れた協働パートナーと位置づけており、その用途にはセキュリティ上の欠陥の特定だけでなく、発見済みの問題の修正も含まれる。同社の説明によると、このモデルは実践的な脆弱性研究と複雑なコード合成を加速し、リアルタイムの脅威インテリジェンスにも対応する。

原文を読む →

OpenAI、Astraの「監視不能」論争に回答

行业动态

OpenAI、Astraの「監視不能」論争に回答

原文を読む →

米司法省、The New York TimesによるOpenAI著作権訴訟でフェアユースの主張を支持

行业动态

原文を読む →

智谱、Tmallに公式旗艦店をオープン

行业动态

智谱、Tmallに公式旗艦店をオープン

原文を読む →

WorkBuddyオープンプラットフォームが公開、Agentの基盤機能を全面開放

行业动态

原文を読む →

gpt-6-astraがOpenAI APIにデプロイ済みとの推測がネット上で浮上

前瞻与传闻

gpt-6-astraがOpenAI APIにデプロイ済みとの推測がネット上で浮上

原文を読む →

Elon Musk、Grok 4.7を10日後にリリースすると発表

前瞻与传闻

Elon Musk、Grok 4.7を10日後にリリースすると発表

原文を読む →