デイリー AI ニュース

2026-08-01

出典:橘鸦 AI 早报 · 15 件

2026-08-01
2026-08-03 2026-08-02 2026-08-01 2026-07-31 2026-07-30 2026-07-29 2026-07-28 2026-07-27 2026-07-26 2026-07-25

DeepSeek-V4-Flash 正式版 API が公開ベータテストを開始

要闻

DeepSeek-V4-Flash 正式版 API が公開ベータテストを開始

DeepSeekはDeepSeek-V4-Flash正式版APIの公開ベータテスト開始を発表した。現時点ではAPI側のみの更新で、AppとWeb版のモデルは変更されず、モデル重みは関連プラットフォームで公開されている。本モデルはプレビュー版とアーキテクチャとパラメータ規模は同じで、再トレーニングのみが行われており、Agent能力が大幅に向上し、複数のAgentベンチマークでV4-Pro-Previewを大きく上回った。また、本モデルはResponses APIをネイティブサポートし、Codexに対応している。さらに、公式はDeepSeek-V4-Proが(原文未完)

DeepSeekは、DeepSeek-V4-Flash正式版APIが公開ベータテストを開始したことを発表した。正式版のモデルIDはDeepSeek-V4-Flash-0731で、モデル構造とサイズはDeepSeek-V4-Flash-previewと同一であり、再トレーニングのみが行われた。公式データによると、正式版は複数のAgentベンチマークテストでV4-Pro-Previewを大幅に上回っている。公開ベンチマークテストセットのCode Agentタスクでは、正式版は近日公開予定のDeepSeek Harnessのミニマルモードをフレームワークとしてテストに使用している。さらに、このモデルはResponses API形式をサポートし、Codexに特化して適合している。公式ドキュメントには、DeepSeek-V4-Pro APIが2026年8月初旬にCodexへの接続をサポートする予定であることも示されている。今回のアップグレードはDeepSeek-V4-FlashのAPIインターフェースのみで、APPおよびWeb版のモデルは変更されていない。モデルの重みは関連プラットフォームで公開されている。

原文を読む →

字节跳动SeedがSeedance 2.5を正式リリース、1回の動画生成時間が30秒に向上

要闻

字节跳动SeedがSeedance 2.5を正式リリース、1回の動画生成時間が30秒に向上

字节跳动SeedはSeedance 2.5を正式にリリースした。本モデルは前世代のアーキテクチャを踏襲し、長いナラティブ能力、マルチモーダル参照能力、編集能力に重点的に取り組み、1回の動画生成時間が15秒から30秒に向上した。モデルは現在、即梦AIと豆包プロフェッショナル版に順次登場しており、APIサービスは近日中に火山方舟で提供開始予定。

字节跳动Seedは、次世代ビデオ生成モデルSeedance 2.5を正式に発表した。Seedance 2.0のマルチモーダル音声・ビデオ統合生成アーキテクチャを継承し、長編ナラティブ能力、マルチモーダル参照能力、編集能力の向上に重点を置いている。Seedance 2.5は、1回のビデオ生成時間を15秒から30秒に延長し、複数回の延長をサポートする。ユーザーは最大30枚の画像、10本のビデオ、10本の音声を参照素材として入力できる。このモデルは、タイムスタンプによる音声・ビデオコンテンツの正確な編集をサポートし、グリーンスクリーン編集、視点編集など多彩な編集機能を強化している。Seedance 2.5は、順次「即梦AI」と「豆包プロフェッショナル版」プラットフォームに展開されており、企業ユーザー向けのAPIサービスは近く「火山方舟」に登場する予定だ。

原文を読む →

ChatGPTデスクトップアプリ、ペットをクリックして音声モードをすばやく起動可能に

开发生态

ChatGPTデスクトップアプリ、ペットをクリックして音声モードをすばやく起動可能に

ChatGPTデスクトップアプリは、仮想ペットショートカット機能の追加を発表した。ユーザーはデスクトップの仮想ペットをクリックするだけで、ChatGPT Voice音声モードをすばやく起動できる。

ChatGPT公式は、デスクトップアプリケーションに仮想ペットによるクイック操作機能が新たに追加されたことを発表した。現在、ユーザーはデスクトップアプリでペットをクリックするだけで、ChatGPT Voiceをすばやく開くことができる。このショートカットを使用すると、ユーザーは作業の進捗を確認し、関連タスクを承認または停止できる。公式は、このアップデートによりデスクトップ版のユーザーエクスペリエンスが向上したと述べている。

原文を読む →

Google AI Studio、独立モバイルアプリを中止しGeminiアプリに統合

开发生态

Google AI Studio、独立モバイルアプリを中止しGeminiアプリに統合

Google AI Studioは、80万回以上の予約を獲得した独立モバイルアプリを中止した。公式は関連機能をGeminiアプリに統合し、日常会話の中で自然に機能するようにすることを決定した。同時に、公式はWeb版の最適化を継続し、ユーザーの高度な開発ニーズに応える。

Google AI Studioは、独立したモバイルアプリのリリース計画を中止した。これまでに、このアプリはiOSおよびAndroidプラットフォームで80万回以上の事前注文を獲得していた。公式は新たな方針として、AI StudioのエクスペリエンスをGeminiアプリのモバイル版とデスクトップ版に直接統合し、日常会話の中で自然に機能させることを決定した。同時に、Google AI Studioはウェブ版のエクスペリエンス向上に引き続き注力し、より高度な開発ニーズを持つユーザーにサービスを提供する。

原文を読む →

GPT-5.4シリーズは8月31日にCodexから提供終了

开发生态

GPT-5.4シリーズは8月31日にCodexから提供終了

OpenAIは、GPT-5.4とGPT-5.4 miniが、ChatGPTでログインしているCodexユーザーに対して8月31日に利用停止となるが、APIでは引き続き利用可能であると発表した。

OpenAIは、GPT-5.4およびGPT-5.4 miniが8月31日をもって正式にCodexから退役し、ChatGPTアカウントでログインしているユーザーには提供されなくなると発表した。これらの2つのモデルは、OpenAI APIおよびAPIキーで認証されたCodexセッションでは引き続き利用可能である。公式は開発者に対し、既存のgpt-5.4をgpt-5.6-terraに、gpt-5.4-miniをgpt-5.6-lunaに置き換え、この期限までに関連するすべてのデフォルト設定とカスタムタスクを更新することを推奨している。

原文を読む →

Nous Research、公式初のHermes DesktopプラグインKanbanと専用プラグインSDKを発表

开发生态

Nous Research、公式初のHermes DesktopプラグインKanbanと専用プラグインSDKを発表

Nous Researchは、公式初のHermes DesktopプラグインKanbanと、対応するDesktop Plugin SDKを発表した。開発者はビルドステップなしでカスタムプラグインをロードでき、デスクトップアプリに拡張機能を追加できる。

Nous Research は公式に、初のHermes Desktopプラグイン「Kanban」が上线したことを発表しました。デスクトップネイティブ版は多くのユーザーからの要望に応えてリリースされ、大幅なアップグレードが施されています。併せて公開されたDesktop Plugin SDKの対応モジュール「@hermes/plugin-sdk」により、開発者はHermes Desktopネイティブアプリに独立したページ、サイドバーナビゲーション、ショートカットキー、ステータスバー操作、テーマ、バックエンドインターフェースなどの機能を追加できます。

原文を読む →

千问、Qwen-Audio-3.0-ASR-Flash音声認識大規模モデルを発表

模型发布

千问、Qwen-Audio-3.0-ASR-Flash音声認識大規模モデルを発表

千问は音声認識大規模モデルQwen-Audio-3.0-ASR-Flashを発表し、阿里云百炼プラットフォームで提供開始した。公式によると、本モデルはコンテキストメモリ、業界用語認識、音声リファインメントなどの5つの面でアップグレードされ、30言語をサポートする。

Qwenは正式に音声認識大モデル「Qwen-Audio-3.0-ASR-Flash」を発表し、現在はAlibaba Cloudの百炼プラットフォームを通じてAPI提供されています。Flash、Filetrans(オフライン音声書き起こし)、Streaming(リアルタイム音声認識)の3つのバージョンを提供し、Flashバージョンは最大5分間の音声書き起こしをサポートします。新モデルは、文脈一貫性、業界用語認識、ホットワードカスタマイズ、音声の磨き上げ、多言語認識の5つの次元でシステム的にアップグレードされました。公式の内部評価によると、医療シーンでの専門用語再現率は95.36%、産業シーンでは93.24%、ホットワード再現率は大半のシーンで99%を超え、7言語の平均セマンティックエラー率は17.09%です。Streamingバージョンの理論上の文字出力遅延は300ミリ秒で、中国語産業シーンでの誤字率は7.8%です。

原文を読む →

美団、LongCat-Flash-Lite-Sparseを発表、新しいスパースアテンションフレームワークを採用

模型发布

美団、LongCat-Flash-Lite-Sparseを発表、新しいスパースアテンションフレームワークを採用

美団はLongCat-Flash-Lite-Sparseモデルをオープンソース化した。これは総パラメータ数69B、活性化パラメータ約3BのMoEモデルで、LongCat Sparse Attentionを導入し、最大1Mトークンのコンテキスト長をネイティブでサポートする。

MeituanはHugging Face上で「LongCat-Flash-Lite-Sparse」モデルを公開しました。このモデルは非thinkingのMoEアーキテクチャで、総パラメータ数は69B、トークンあたりのアクティブパラメータ数は約3Bです。LongCat Sparse Attention(LSA)を導入し、ネイティブに最大1Mトークンのコンテキスト長をサポートします。前世代の高密度モデルと比較して、LongCat-Flash-Lite-Sparseは推論と汎用知識の性能を維持しながら、長コンテキスト推論効率とエージェント能力を向上させています。モデルウェイトはMITライセンスでオープンソース化されており、SGLangを使用してシングルノードでデプロイ可能です。

原文を読む →

商湯、SenseNova-U1.5-8B-MoTプレビュー版をオープンソースで公開

模型发布

商湯、SenseNova-U1.5-8B-MoTプレビュー版をオープンソースで公開

SenseNovaはSenseNova-U1.5-8B-MoTプレビュー版をオープンソースで公開した。ネイティブ4K画像生成と詳細な画像編集をサポートし、同時に事前学習スクリプトと設定ファイルを公開した。公式は、より完成された正式版が近くリリースされると述べている。

SenseNovaは「SenseNova-U1.5-8B-MoT」(プレビュー版)を発表し、オープンソースとして公開しました。これはNEO-unifyアーキテクチャに基づいて構築されたネイティブ統合マルチモーダルモデルで、新しいパッチエンコーディング層とConvDecoderデコード層を導入しています。前世代のU1と比較して、このプレビュー版はネイティブ4K画像生成をサポートし、テクスチャ、材質、照明、リアリティの面で大幅に向上し、中国語と英語のテキストレンダリングと高密度・複雑なレイアウト整理能力が強化されました。画像編集では、命令追従、主体のアイデンティティ保持、構造的一貫性のすべてが改善され、マスク、バウンディングボックス、ビジュアルマーカーによる領域制御可能な細粒度編集をサポートします。公式には、より強力で完成度の高い正式版が近日中にリリースされる予定です。

原文を読む →

LG AI研究院がオープンソースモデルK-EXAONE 2.0を発表

模型发布

LG AI研究院がオープンソースモデルK-EXAONE 2.0を発表

LG AI研究院はオープンソースモデルK-EXAONE 2.0を発表した。このモデルは総パラメータ数7500億、活性化パラメータ370億を持つ。公式データによると、長いコンテキスト理解と安全性などのベンチマークで優れた性能を示し、10言語をサポートしている。

LG AI研究院はHugging Face上で「K-EXAONE 2.0」モデルを正式に発表しました。これは韓国科学技術情報通信部の主権人工知能基盤モデルプロジェクトの下で開発された第2世代製品です。新モデルはハイブリッドアテンションMoEアーキテクチャを採用し、総パラメータ数7500億、アクティブパラメータ数370億で、規模は初代の3倍以上です。モデルはマルチトークン予測とDSparkの2つの投機的デコード手法をサポートし、生成速度を約3〜5倍高速化し、多言語対応範囲を6言語から10言語に拡大しました。このモデルはApache 2.0ライセンスで完全にオープンソース化されており、公式に発表されたベンチマークデータによると、長コンテキスト検索と安全性のパフォーマンスは既存の主要なオープンソースモデルの多くを上回っています。

原文を読む →

華為、openPangu-2.0-Proモデルをオープンソース化、総パラメータ5050億

模型发布

華為、openPangu-2.0-Proモデルをオープンソース化、総パラメータ5050億

華為は、昇腾 NPUでトレーニングされたopenPangu-2.0-Proモデルをオープンソース化した。このモデルの総パラメータ数は約5050億で、現在モデル重み、基本的な推論コード、技術レポートが提供されている。公式は、複雑なソフトウェアエンジニアリングタスクにおいては、依然としてトップモデルとの差があると指摘している。

华为は、昇腾NPUでトレーニングされた大規模混合専門家モデル openPangu-2.0-Pro をオープンソース化し、関連する重み、推論コード、技術報告書を正式に公開しました。このモデルの総パラメータ数は約5050億、活性化パラメータは約180億で、512Kのコンテキスト長をサポートし、DSA+SWAの独立階層ハイブリッドアーキテクチャとMuonオプティマイザーを採用しています。技術報告書には、ThinkingモードとNon-Thinkingモードの評価データが含まれています。公式によると、このモデルは汎用能力と論理的推論の面で優れた性能を示していますが、複雑な現実世界のソフトウェアエンジニアリングタスクを処理する際には、最先端モデルとの間に明らかなギャップがまだあることを認めています。

原文を読む →

MiniMaxがMiniMax Hubを開設し、Media Planサブスクリプションプランを発表

产品应用

MiniMaxがMiniMax Hubを開設し、Media Planサブスクリプションプランを発表

MiniMax公式はMiniMax Hubを正式に開設し、新しいMedia Planサブスクリプションプランを発表した。主に動画生成、画像作成、楽曲制作、音声合成などの主要なクリエイティブシーンを対象とし、Seedance 2.0、MiniMax H3、Seedream 5.0 Proなどの主要モデルをサポートしている。

MiniMaxは公式にMiniMax Hubを立ち上げ、音声・動画クリエイター、映像コンテンツ制作チーム、コンテンツマーケティングチーム向けに、新しいMedia Planサブスクリプションプランを発表しました。MiniMax公式プラットフォームの情報によると、MiniMax APIオープンプラットフォームは現在、1日あたり1兆トークンを超えるリクエストを処理し、累計10万人以上の開発者にサービスを提供しています。新しいMedia Planは、動画生成、画像生成、BGM制作、音声合成などの主要なクリエイティブシーンをカバーし、Starter、Plus、Proの3層の年間サブスクリプションプランを提供し、Seedance 2.0、MiniMax H3、Seedream 5.0 Proなどの主要モデルをサポートしています。

原文を読む →

Google EarthのAI画像生成機能が公開1日で撤回される

行业动态

Google EarthのAI画像生成機能が公開1日で撤回される

Googleは公開からわずか1日でGoogle EarthのAI画像生成機能をロールバックした。ユーザーが規約違反と思われる生成スクリーンショットを共有していることが判明したため、Googleは対策を強化する間、一時的にこの機能を撤回することを決定した。

Googleは先頃、Google EarthにAI画像生成機能を導入しました。この機能により、ユーザーは同社の画像生成モデルNano Banana 2を使用し、プロンプトを通じて衛星地図上に架空の画像を作成し、実際の地図に重ね合わせることができます。この機能は公開後すぐに批判を浴び、評論家はこのツールが虚偽の地理情報の作成や拡散に悪用される可能性があると指摘しました。その後、Googleは公式声明を発表し、一部のユーザーがプラットフォームのポリシーに違反する可能性のある生成画像のスクリーンショットを共有しているのを確認したため、より強力な保護措置を実装する間、この機能をロールバックすることを決定したと述べました。また、Googleは生成された画像がGoogle Earthのメインインターフェースで他のユーザーに表示されることはなく、AI生成であることを示す透かしが付けられていると指摘しました。

原文を読む →

テスラが車載システム更新、豆包大規模モデル音声アシスタントを導入

行业动态

報道によると、テスラ中国はModel 3などの車種に新しいバージョンの車載ソフトウェアアップデートを配信し、中心的な新機能として豆包大規模モデルによるスマート音声アシスタントを追加した。

テスラ中国は、バージョン2026.14.13の車載ソフトウェアアップデートをリリースし、Model 3、Model Y、Model S、Model X向けに段階的に配信を開始しました。これはテスラが中国の車載システムにサードパーティの大規模言語モデルサービスを初めて導入したものです。豆包大規模言語モデルを搭載したスマート音声アシスタントは、自然で流暢な対話とリアルタイム情報検索を実現し、複数の音声と「万事通」「音楽愛好家」「故事会」などのパーソナライズされたキャラクターを提供しますが、使用にはプレミアム車載エンターテイメントサービスの契約が必要です。公式の更新説明によると、この音声アシスタントは現在、車両制御コマンドをサポートしておらず、音声によるエアコン調整やナビ設定などの車載操作はできません。フィードバックによると、今回のアップデートはHW 3.0以前のハードウェアを搭載した車両、つまりAI4ハードウェア以外の車両に適用されます。

原文を読む →

数学者がGPT-5.6 Solがマクスウェル予想の反例を発見したと主張

技术与洞察

数学者がGPT-5.6 Solがマクスウェル予想の反例を発見したと主張

数学者Philip Arathoon氏は、GPT-5.6 Solがマクスウェル予想の反例を発見したと述べた。5つの点電荷の三角両錐体が24個の平衡点を生み出し、予想の上限を超えるというものだ。

Philip Arathoon氏はソーシャルプラットフォーム上で、マクスウェルの予想が反証されたと発表し、反例はAI(GPT-5.6 Sol)によって発見され、人間の数学者が論文を整理してarXivに投稿したと述べました。この反例は、5つの点電荷からなる三角双錐構造で、24個の平衡点を生成し、予想が与える (n-1)² の上限を超えています。Greg Brockman氏はこのニュースを転載し、GPT-5.6 Solが100年以上の数学予想を解決できると述べました。別のユーザーは、マクスウェルの原文の実際の表現は (n-1)(n-2) であり、(n-1)² ではないこと、また本人はその表現を「予想」と呼んだことはなく、「予想」という名称は2007年に後世の研究者によって提案されたと指摘しました。現在、この発見はまだ独立した検証を受けていません。

注意:この内容はAI支援で作成されたもので、幻覚や誤りが含まれる可能性があります。

原文を読む →