デイリー AI ニュース

2026-08-03

出典:橘鸦 AI 早报 · 5 件

2026-08-03
2026-08-03 2026-08-02 2026-08-01 2026-07-31 2026-07-30 2026-07-29 2026-07-28 2026-07-27 2026-07-26 2026-07-25

MiniMax H3 マルチモーダルビデオモデル、本日ウェイト公開予定

要闻

MiniMax H3 マルチモーダルビデオモデル、本日ウェイト公開予定

MiniMaxは本日、次世代マルチモーダルビデオモデルMiniMax-H3のモデルウェイトを公開する予定です。この記事の公開時点では、関連ページはまだオープンソース化予定の状態を示しています。

MiniMaxは、次世代のオープンな汎用マルチモーダル動画モデル「MiniMax-H3」を近日中にオープンソース化する予定です。関連ページによると、公開予定時刻は2026年8月3日06:00(UTC+08:00)で、その時点でユーザーはModelScope魔搭社区でモデルの重みを取得できるようになります。ただし、本号の配信時点では、関連ページはまだオープンソース化前の状態を示しています。

原文を読む →

FFmpeg、Cursor AIが複数の開発者に無料枠を提供したことに感謝

行业动态

FFmpeg、Cursor AIが複数の開発者に無料枠を提供したことに感謝

FFmpeg公式アカウントが、Cursorが複数のFFmpeg開発者に無料枠を提供したことに感謝する投稿をしました。FFmpegは、これらの枠はプロジェクトの継続的な開発とコードレビュー作業を支援するために使用されると述べています。

FFmpeg公式アカウントが公開投稿で、Cursor AIが複数のFFmpeg開発者に無料枠を提供してくれたことに感謝を表明しました。FFmpegによると、この枠によってFFmpegプロジェクトの継続的な作業(開発やコードレビューを含む)がサポートされるとのことです。FFmpegは、CursorがFFmpegとそのコミュニティを支援してくれたことに深く感謝していると述べています。

原文を読む →

元Googleチームメンバー、GoogleはChatGPT以前に類似製品LMChatを持っていたと語る

行业动态

元Googleチームメンバー、GoogleはChatGPT以前に類似製品LMChatを持っていたと語る

Codexの責任者Tibo氏は最近、ネットユーザーへの返信で、GoogleはChatGPTの発表の約1年前に類似製品LMChatを持っていたと述べました。彼は関連チームで働いていましたが、この製品は検索事業への影響を懸念して公開されませんでした。

Codexの責任者であるTibo氏は最近、ネットユーザーへの返信で、GoogleはChatGPTの公開の約1年前にすでに類似の製品を開発していたと述べました。彼はその関連チームで働いたことがあり、当初のコードネームはLMChatで、後に別のコードネームに変更されたとのことです。Tibo氏によると、Googleはこの製品が検索ビジネスに影響を与えることを懸念して公開しなかったとのことです。また、DeepMindもGoogleの製品を覆す可能性のある製品のリリースを阻止されていました。以前、ネットユーザーがJeff Dean氏のインタビューを引用して、GoogleはChatGPT以前に社内用チャットボットを持っていたと指摘していました。

原文を読む →

Andrej Karpathy氏、ペリカンが自転車に乗るテストでLLMを評価すべきではないと発言

技术与洞察

Andrej Karpathy氏、ペリカンが自転車に乗るテストでLLMを評価すべきではないと発言

Andrej Karpathy氏は最近、ペリカンが自転車に乗るテストでLLMを評価すべきではないと投稿しました。彼はOpus 5を使用して3Dワールド生成能力のテストを行い、「指輪物語」の最初の段落を入力して、three.jsでストーリーをレンダリングするよう要求しました。結果は「少し粗いが面白い」と述べています。

Andrej Karpathy氏は最近、LLMをテストするためにペリカンが自転車に乗る画像を使うべきではないと投稿しました。彼はOpus 5を使用して3Dワールド生成能力のテストを行い、『指輪物語』の最初の段落を入力し、約100万トークン(約10ドル)の予算で、three.jsを使ってストーリーをレンダリングするよう要求しました。Opus 5は約2時間実行し、5500行のコードを書き、プログラムによりストーリーのシーンをレンダリングしました。Karpathy氏は結果は粗いが実行可能だと述べ、LLMは3次元座標系でポリゴンアセットを配置・整理し、アニメーションコードを書く必要があると指摘しました。また、現在のLLMはワールドとゲーム分野に弱点があり、ビデオを効率的にネイティブ認識したり、ゲーム内でプレイしたりすることができず、作業を確認するためにゆっくりとスクリーンショットを撮る必要があると指摘しました。

原文を読む →

QwenらがネイティブComputer UseエージェントQwen-CUAを共同リリース

模型发布

QwenらがネイティブComputer UseエージェントQwen-CUAを共同リリース

QwenチームはXLang Labと共同で、ネイティブComputer UseエージェントQwen-CUAをリリースしました。このエージェントはスクリーンショットのみでインターフェースを認識し、キーボードとマウスでコンピュータを操作します。現在、テクニカルレポートと参考デモが公開されています。

Qwen TeamとXLang Labは共同で、QwenベースのネイティブComputer UseモデルおよびエージェントであるQwen-CUAを発表しました。Qwen-CUAはスクリーンショットのみでインターフェースの状態を認識し、DOMツリー、アクセシビリティメタデータ、タスク専用APIに依存せず、ネイティブのキーボードおよびマウスイベントを通じてブラウザ、デスクトップアプリ、専門ソフトウェアで操作を実行します。このモデルは397B-A17BのMixture-of-Expertsアーキテクチャに基づいており、OSWorld-Verifiedベンチマークで86.2点を獲得しました。より大きなバージョンであるQwen-CUA-Maxはパラメータ数が1兆を超え、同じベンチマークで87.6点を達成しました。現在、GitHubでは技術レポートと参考デモのみが提供されています。

注:内容はAI支援で作成されており、幻覚や誤りが含まれる可能性があります。

原文を読む →