デイリー AI ニュース

2026-10-07

出典:橘鸦 AI 早报 · 35 件

2026-10-07
2026-10-07 2026-10-06 2026-10-05 2026-10-04 2026-10-03 2026-10-02 2026-10-01 2026-09-30 2026-09-29 2026-09-28 2026-09-27 2026-09-26

Mistral Large 4が登場、月末に重みを公開へ

要闻

Mistral Large 4が登場、月末に重みを公開へ

Mistral は Mistral Large 4 の公開プレビュー API を提供開始し、発表月の月末に重みを公開する予定としている。総パラメータ数は 1 兆、アクティブパラメータ数は 490 億で、プレビューは Mistral Studio から利用できる。

Mistral は発表時点で Mistral Large 4 の公開プレビューを開始し、発表月の月末に重みを公開すると発表した。原文には発表日が記載されていない。このモデルはネイティブにマルチモーダルに対応し、総パラメータ数は 1 兆、アクティブパラメータ数は 490 億となる。公式説明によると、欧州の自社データセンターに設置した 3,800 基の NVIDIA Grace Blackwell GPUs を使ってゼロから学習し、Mistral Studio のプレビュー API も同じインフラ上で提供している。学習データは EU の全公用語を含む 160 を超える言語をカバーする。重みの公開に先立ち、Mistral はサイバーセキュリティ分野の組織、審査済みのパートナー、国家当局と実環境でのレッドチームテストを実施しており、参加者はコンテンツモデレーションの制限を減らし、サイバーセキュリティ機能を拡張したモデルを使用する。

公式が公表した評価結果によると、ML4 は Artificial Analysis Cyber Index で世界上位 5 モデルに入り、オープンソースソフトウェアの実際の脆弱性を再現して修正するテストで 82% を記録した。セキュリティ競技の問題 40 問からなる Cybench では、課題の 93% を解決した。ソフトウェアエンジニアリング分野では、DeepSWE v1.1、SWE-Atlas-QnA、Terminal-Bench 4 のスコアがそれぞれ 61.7%、59.4%、28.3% で、総合 Coding Agent Index は 49.8% だった。657 件の業務ワークフローを対象とする AutomationBench では 59.9%、長期的な知識労働を評価する AA-Briefcase では 1,393 Elo を記録した。公式は、モデルアーキテクチャ、追加のベンチマーク、post-training 手法の詳細を今後公開するとしている。

原文を読む →

GoogleがNano Banana 2.1を発表、画像生成・編集機能を全面刷新

要闻

GoogleがNano Banana 2.1を発表、画像生成・編集機能を全面刷新

Google の Gemini Image ページの素材には、アウトドアスポーツと旅行を題材にした英語の海報生成 Prompt が 2 件あり、文字、配色、構図が指定されている。モデルの公開日や性能データは記載されていない。

Google は Gemini Image ページの素材で、ポスター生成用の Prompt を 2 件提示している。提供された内容には掲載日がなく、Nano Banana 2.1 の公開時期や機能更新の説明も含まれていない。両方の Prompt は英語の文字を指定し、明瞭に読めることを求めているが、視覚的な配置は異なる。アウトドアスポーツのポスターでは、トレイルランナーの円形写真を改行した大きな文字と重ね、オフホワイトの背景、オレンジと黒の幾何学的要素、座標、標高表示、バーコードを組み合わせる。旅行ポスターでは 1970 年代の映画風の表現を採用し、コバルトブルーの背景とクリーム色の枠で大きな文字を引き立てる。キャンピングカーの屋根に座る女性が文字の一部を隠す構図に、サーフボード、フィルム粒子、暖色の自然光を加える。

原文を読む →

谷歌がマルチモーダル埋め込みモデルEmbeddingGemma 2をオープンソース化

要闻

谷歌がマルチモーダル埋め込みモデルEmbeddingGemma 2をオープンソース化

Googleは7.4億パラメータのEmbeddingGemma 2を公開した。Apache 2.0ライセンスでテキスト、コード、画像、動画、音声の統合embeddingを端末上の検索に提供し、公式発表ではMTEB Codeのスコアが68.76から78.68に上昇した。

Googleは、Gemma 4アーキテクチャに基づくEmbeddingGemma 2を公開した。モデルは7.4億パラメータを持ち、商用利用を認めるApache 2.0ライセンスを採用している。テキスト、コード、画像、動画、音声を同じembedding空間にマッピングし、音声メモから動画クリップを探したり、テキストクエリで音声録音を検索したりできる。公式によると、前世代の多言語テキスト性能を維持しつつ、MTEB Codeのスコアは68.76から78.68へ9.92ポイント上昇した。ローカルのコードベースのインデックス作成、意味に基づくコード検索、coding agentの検索処理に利用できるという。

公式の説明によると、EmbeddingGemma 2はローカルでembeddingsを生成し、完全にオフラインのクロスモーダル検索に対応するほか、Gemma 4と組み合わせて端末上のRAG pipelineを構築できる。両モデルはtext tokenizerとaudio encoderを共有し、併用時の総メモリ使用量を抑えられるという。Googleは、Google AI Edge Galleryで、メディアライブラリの意味に基づく検索を行うInstant Media Searchと、動画内の該当場面を探すVideo Moments Finderの例を提供している。Google AI Edge Foresightでは、ローカルファイル検索と文脈に基づく推論の組み合わせを示している。開発者向けには、モデルカード、推論とファインチューニングのガイド、LiteRTで検索とRAGシステムを構築する記事も用意されている。

原文を読む →

OpenAIが社内のフロンティアモデルによる数学研究の成果を公開

要闻

OpenAIが社内のフロンティアモデルによる数学研究の成果を公開

OpenAI は、社内のフロンティアモデルが生み出した数学の原稿 722 件を 372 の成果群にまとめて公開し、一部の証明には Lean による形式化を添えた。検証の進捗は成果ごとに異なり、同社は未形式化の成果に問題がある可能性を示している。

OpenAI は、社内のフロンティアモデルが生み出した数学研究の成果を GitHub リポジトリで公開した。372 の成果群に整理された 722 件の原稿に加え、論文の改訂と引用に関する取り決めを掲載している。リポジトリには、多くの証明の Lean による形式化、モデルの推論要約 10 件、取り組んだ問題数などの統計も含まれ、今後得られる形式化も追加公開される。公開方法は、高等研究所の数学と人工知能に関する独立諮問グループの助言と公開された提言を参考にした。OpenAI の説明によると、成果の大半は、未公開の同一の社内モデルが固定の手順で得たものである。このモデルには評価で約 4000 問が与えられ、成果 1 件あたり平均約 3 時間分の ChatGPT Pro の思考用計算リソースを使用した。同社は、成果ごとに検証段階が異なり、未形式化の成果には問題がある可能性があるとしている。OpenAI は、AI による重要な成果の理解を支援するため、ワークショップなどへの資金提供も計画しており、これらの成果を生み出したモデルを責任ある形で公開するために取り組んでいると述べている。

原文を読む →

OpenAIがAuto-reviewを無料開放、サブスクリプションの利用枠は消費せず

开发生态

OpenAIがAuto-reviewを無料開放、サブスクリプションの利用枠は消費せず

OpenAI で Codex と ChatGPT を担当する Tibo は、ChatGPT アカウントでログインする全ユーザーに Auto-review を無料開放し、サブスクリプションの利用枠も消費しないと発表した。この機能では、別の agent がメインの agent の操作を審査する。

OpenAI で Codex と ChatGPT を担当する Tibo は、ChatGPT アカウントでログインする全ユーザーが Auto-review を無料で利用できるようになり、利用時にサブスクリプションの利用枠を消費しないと発表した。有効化する場所は、設定 → 権限 → auto-review となる。同氏の説明によると、この機能は長時間のタスク実行中に、別の agent がメインの agent の全操作を確認し、リスクの高い操作やユーザーの当初の意図から外れる操作を阻止するためのものだ。Tibo は、デフォルトのサンドボックス設定ではすべての操作を個別に承認する必要があり、具体的なルールの設定に時間をかけなければ判断疲れが生じやすいと述べた。同氏は Auto-review がこの仕組みを改善すると説明し、full-access 権限の代わりに使うことを推奨するとともに、両者の間でトレードオフを考える必要はもはやないとの見解を示した。

原文を読む →

OpenAIがDecisions APIのパブリックベータを全開発者に開放

开发生态

OpenAIがDecisions APIのパブリックベータを全開発者に開放

OpenAI は Decisions API の公開ベータをすべての開発者に開放し、アプリによるモデル、ツール、アクションの選択に対応した。公式説明では、判断速度は別の呼び出し方式の最大 10 倍で、入力 100 万 token 当たりの料金は 0.1 米ドルとなる。

OpenAI は Decisions API の公開ベータ開始を発表し、すべての開発者に開放した。アプリがほぼリアルタイムでモデル、ツール、アクションを選択するための API となる。GPT-6 Luna を基盤とし、テキストと画像の入力を受け付ける。料金は入力 100 万 token 当たり 0.1 米ドルで、入力のみが課金対象となり、キャッシュおよび出力 token への課金はない。公式によると、Responses API 経由で GPT-6 Luna を呼び出す場合と比べ、判断速度は最大 10 倍となる。

出力は 3 種類ある。Predicates は記述が真である確率を推定し、Choices は事前定義された選択肢から選んで信頼度を示し、Scores は数値範囲に沿って入力を評価する。公式説明では、用途として、適切なモデル、ツール、Agent へのリクエストの振り分け、大量の入力へのラベルとスコアの生成、画像の分析またはスクリーンショットに基づくアクションの決定、高リスクなツール呼び出しの識別が挙げられている。

原文を読む →

OpenAIがAPIの有料利用ティアを5段階から3段階に簡素化

开发生态

OpenAIがAPIの有料利用ティアを5段階から3段階に簡素化

OpenAI は API の有料利用階層を5段階から Build、Launch、Grow の3段階に統合すると発表した。最上位の資格に必要な累計支払額は1000米ドルから500米ドルとなり、既存の有料組織は自動移行する。

OpenAI は API の有料利用階層を従来の5段階から Build、Launch、Grow の3段階に変更すると発表したが、原文には適用開始日の記載がない。今回の変更は、より高い API レート制限を利用するための資格条件に関わる。最上位の Grow では API の累計支払額が500米ドルに達することが条件となり、従来の最上位では1000米ドルが必要だった。公式の説明によると、すでに有料階層に属する組織は対応する新階層へ移行し、手動での操作は不要となる。各階層の資格条件とレート制限の詳細は、OpenAI プラットフォームの組織の制限設定ページに掲載されている。

原文を読む →

Space Bunnyの無料期間が終了へ、OpenCodeの支援で数日間延長

开发生态

Space Bunnyの無料期間が終了へ、OpenCodeの支援で数日間延長

Space Bunny の無料提供期間がまもなく終了するため、オープンソースのコーディング Agent OpenCode は、自社の無料枠で同モデルをさらに数日間提供できるよう費用を負担すると発表した。OpenCode によると、モデルは調整中で、正式公開前にも調整を続ける。

オープンソースのコーディング Agent OpenCode は X で、まもなく終了する Space Bunny の無料提供期間を引き継ぐ形で、自社の無料枠でさらに数日間提供できるよう費用を負担すると発表した。今回公表された措置は、OpenCode による Space Bunny の無料提供への支援に関するもので、モデル自体はまだ正式公開前の調整段階にある。OpenCode の説明によると、Space Bunny は現在調整中で、正式公開まで引き続き調整が行われる。

原文を読む →

AnthropicがCVPを拡充、3つのティアで高度なネットワーク機能を提供

开发生态

AnthropicがCVPを拡充、3つのティアで高度なネットワーク機能を提供

Anthropic は CVP を3段階のアクセス制度に拡張し、条件を満たすセキュリティチームに高度なサイバー機能とブロックを抑えたモデルアクセスを提供する。対象には Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 が含まれる。

Anthropic は拡張版 Cyber Verification Program(CVP)を開始し、従来の CVP と Project Glasswing を統合した。セキュリティ業務の範囲に応じて3段階のアクセス権を設け、それぞれ異なる検証要件とセキュリティ管理を適用する。全段階で Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 と今後の新モデルを利用できる。Defense Access はインシデント対応、malware のリバースエンジニアリング、脆弱性の分析・検証などの防御業務を対象とする。申請対象には、自ら所有または維持するシステムを守る組織、重要インフラ運営者、小規模なセキュリティ企業、オープンソースのメンテナー、脆弱性の報告実績がある個人研究者が含まれる。同社は、この段階の申請には数日以内の回答を目指すとしている。

Red Team Access は防御用途に加え、許可を得たペネトレーションテストと red-teaming を認める。現在は組織のみが申請でき、個人研究者は対象外となる。ransomware の展開や物理システムの破壊など、身体的危害や大規模な障害につながり得る操作は引き続きリアルタイムでブロックされる。同社は審査に数週間を見込み、条件を満たす組織は審査中に Defense Access を利用できるとしている。Specialized Access はサイバー関連のブロックが最も少なく、電力網や飛行運用システムなどの安全システムをテストする許可を得た、少数の検証済み組織に限定される。Anthropic は現在、米国政府と協力して各組織を詳細に審査しており、既存の Project Glasswing メンバーはこの段階へ移行し、現行モデルについて再承認を必要としない。プログラムではサイバー悪用の監視のためデータ保持を要求するが、Claude Fable 5.1 または Claude Mythos 5.1 のゼロデータ保持アクセスを既に持つ組織は、EFS が利用可能になるまで CVP もゼロデータ保持で利用できる。

原文を読む →

复旦・腾讯・浙大がPrismをオープンソース化、ネイティブ2Kの映像・音声同時生成に対応

模型发布

复旦・腾讯・浙大がPrismをオープンソース化、ネイティブ2Kの映像・音声同時生成に対応

復旦大学、Tencent Hunyuan、浙江大学のチームが Prism をオープンソース化し、ネイティブ 2K 音声・映像同時生成のコードとプレビュー重みを MIT ライセンスで公開した。公式実験によると、学習速度は全注意力比で 2.5 倍となった。

復旦大学、Tencent Hunyuan、浙江大学のチームは、動的スパース Attention フレームワーク Prism を公開し、技術レポート、学習・推論コード、プレビュー重みを同時に MIT ライセンスで提供した。プレビューモデルは MOVA-360p をベースとし、720p、1080p、2K の解像度でネイティブな音声・映像同時生成と学習に対応し、テキストからの動画生成と画像からの動画生成を扱う。プロンプト内の music、sfx、speech タグは、それぞれ音楽、効果音、セリフの制御に用いる。公開済みの重みには安定性寄りの preview-alpha と動き寄りの preview-beta があり、Prism-pro は未公開。公式によると、実験では Prism の学習速度が全 Attention 比で 2.5 倍となり、生成品質も全 Attention を上回った。計算資源の要件は、720p 推論が VRAM 80GB の GPU 1 基、1080p と 2K の推論が GPU 4 基以上、ネイティブ 2K 学習が GPU 64 基以上となる。

原文を読む →

亚马逊のAGIチームがALoDLM-8Bをオープンソースで公開

模型发布

亚马逊のAGIチームがALoDLM-8Bをオープンソースで公開

Amazon の AGI チームは ALoDLM-8B をオープンソースで公開した。exit gate で終了スケジュールを変分分布として表し、c = 0.4 の切断幾何事前分布を用いることで、全スケジュールに対する指数個の独立した rollout を回避する。

Amazon の AGI チームが ALoDLM-8B をオープンソースで公開し、その説明で終了深度を共同でモデル化する手法を示した。token を確定するたびに、未確定の token のコンテキストが変わるため、終了深度を個別に扱うことはできない。すべての終了スケジュールについて和を取るには、指数個の独立した rollout が必要になる。同チームの説明によると、モデルは代わりに exit gate で終了スケジュール上の変分分布 qϕ をパラメータ化し、c = 0.4 の切断幾何事前分布 π を導入することで、事前分布が浅い終了深度を優先するようにしている。

原文を読む →

Perplexityが意思決定モデルpplx-deciderの新バージョンを公開

模型发布

Perplexityが意思決定モデルpplx-deciderの新バージョンを公開

Perplexity はオープンウェイトのマルチモーダル意思決定モデル pplx-decider-v1.1-27b を公開した。モデルカードに記載された Decision Index の総合スコアは 61.56 で、Decision API の入力 token 100万件当たりの料金は v1 の半額となる 0.02 米ドル。

Perplexity は、更新版の pplx-decider-v1.1-27b が利用可能になり、Decision API の料金が v1 の半額となる入力 token 100万件当たり 0.02 米ドルに下がったと発表した。同モデルはオープンウェイトで、マルチモーダルの意思決定に対応する。モデルカードによると、バックボーンは引き続き Qwen3.8-27B をベースとし、パラメータ数は 26B、精度は BF16。モデルカードに記載された Decision Index の総合スコアは v1 の 56.4 から 61.56 に上がり、Jev を 3.5 ポイント超上回った。公式説明では、新版の Hugging Face Decision Index 0.3 ベンチマークで最高スコアを記録したとしており、改善は主に因果マスクの解除と、tasksource データを含む学習データの追加によるものだという。

原文を読む →

EmpirioLabsが意思決定モデルAplomb 1を発表

模型发布

EmpirioLabsが意思決定モデルAplomb 1を発表

EmpirioLabs は決定モデル Aplomb 1 の API、Playground、重みを公開し、複数の入力形式と最大 1,000,000 tokens を単一リクエストで扱えるようにした。公式説明では、この長さの文書を高速モードで処理する時間は約 3 秒だが、文書全体の判断では完全読み取りより正答率が低い。

EmpirioLabs 初の決定モデル Aplomb 1 は、2026 年 10 月 6 日時点で同社の API と Playground で提供されており、重みは Hugging Face を通じて EmpirioLabs Model License の下で公開されている。モデルは単一リクエストでテキスト、JSON、画像、音声、動画を受け取り、入力状態と最長の質問を合わせて最大 1,000,000 tokens を扱える。Agent 向けには、各ツールの確率と enum および boolean 引数の確率分布を一度に返し、自由記述の引数は Agent が埋める。同じ状態に最大 128 個の質問を設定でき、公式説明によると、各質問は独立して回答され、質問の追加は他の回答を変えない。abstain を有効にすると、回答に必要な情報が入力に含まれていない確率も出力される。

公式説明によると、API と Playground は 131,072 tokens を超える状態に高速長コンテキストモードを標準で適用し、1,000,000 tokens の文書を約 3 秒で処理する。完全読み取りでは約 111 秒かかる。同社の長コンテキストテストでは、高速モードが 525 件すべての決定に正答し、完全読み取りの正答率は 95.2% だった。一方、件数の集計、全体の語調、特定の内容が一度も現れないことの確認など、文書全体の判断を検証する 24 文書では、正答率はそれぞれ 50% と 61% だった。リクエストに "long_context": "full" を設定すると完全読み取りに切り替わり、どちらのモードでも状態全体が使用量として計上される。高速モードは同社の API と Playground のみで利用でき、公開された重みはすべての token を読み取る。

原文を読む →

OpenAIのdotsチーム、公開から1週間で一連の改善を実施したと発表

产品应用

OpenAIのdotsチーム、公開から1週間で一連の改善を実施したと発表

OpenAI dots のプロジェクトメンバーである Rohan Varma は、公開後1週間で、ユーザーのフィードバックを基に性能、通知、表示、アクセス機能を更新したと説明した。今後は音声の信頼性、Codex アプリの制御、複数のコンピューターへの接続、Windows のローカル制御に取り組む予定だ。

OpenAI dots のプロジェクトメンバーである Rohan Varma は、dots の公開後1週間で、チームがユーザーのフィードバックに基づく複数の改善を実施したと説明した。同氏によると、クラウド上のブラウジング、サイドバーの読み込み、アニメーションの動作を調整し、応答を待つ間の停止も減らした。修正対象には、ChatGPT 利用時にモバイル端末で余分な通知が届く問題、Safari と Firefox の文字レンダリングの問題、Outlook の設定が進まなくなる問題が含まれる。承認画面のボタンが切れて表示される問題、大きすぎる Gmail のプレビューが承認操作を覆う問題、Web 版および音声起動時の企業向けアクセスの問題も修正対象となった。チームはさらに、Web 版のセキュリティバナーの安定性を調整し、計画に関する案内を明確にするとともに、アクティビティの読み込みに失敗した際の再試行手段を追加した。今後の作業には、音声の信頼性の継続的な改善、dot による Codex アプリの制御範囲の拡大、dot の複数コンピューターへの接続対応、Windows 上のローカルコンピューター制御のサポート改善が含まれる。

原文を読む →

ChatGPTがMeetingsプラグインを公開、会議メモを自動作成

产品应用

ChatGPTがMeetingsプラグインを公開、会議メモを自動作成

ChatGPT は、会議のノート、個人に合わせた要約、次のステップを作成し、ChatGPT Space に保存する Meetings プラグインのベータ版を公開した。現在は Pro と Business のユーザーのみが macOS デスクトップアプリで利用できる。

ChatGPT は現在、Meetings プラグインのベータ版を提供しており、Pro と Business のユーザーが macOS 版 ChatGPT デスクトップアプリで利用できる。プラグインは会議中にノートを記録し、ChatGPT が把握しているユーザー本人や過去の共同作業の内容を踏まえて、個人に合わせた要約と次のステップを作成し、ChatGPT Space に保存する。ユーザーはノートを非公開にするか、チームに共有でき、その後 ChatGPT にプロジェクト計画の更新やフォローアップ文面の下書きを依頼することもできる。インストールには、まずデスクトップアプリをダウンロードし、プラグインディレクトリで Meetings を検索する必要がある。公式は、Enterprise 版でもまもなく対応するとしている。

原文を読む →

ClaudeのWeb版とデスクトップ版に簡体字・繁体字中国語のUIがひっそり登場

产品应用

ClaudeのWeb版とデスクトップ版に簡体字・繁体字中国語のUIがひっそり登場

複数のユーザーが、Anthropic の Claude の Web 版とデスクトップアプリで簡体字・繁体字中国語の UI が利用でき、いずれも設定から手動で切り替えられることを確認した。別のユーザーは、一部地域の Web 版の購読アップグレード画面で中国の住所を選択でき、UnionPay International カードへの対応も表示される一方、決済を試みて拒否された例があると報告した。

複数のユーザーの報告によると、Anthropic の Claude の Web 版とデスクトップアプリに簡体字中国語と繁体字中国語の UI が追加された。どちらも設定から表示言語を手動で切り替えられ、UI が自動的に中国語に変わったユーザーもいた。ほぼ同じ時期に、別のユーザーが Web 版で購読をアップグレードする際、一部地域の画面で中国の住所を選択でき、UnionPay International カードへの対応が表示されることを確認した。支払いを試みたユーザーもいたが、注文は拒否された。この決済結果と画面上のカード対応情報は、いずれもユーザーの報告に含まれている。

原文を読む →

ClaudeがGoogle Workspaceプラグインを公開

产品应用

ClaudeがGoogle Workspaceプラグインを公開

Claude for Google Workspace の public beta がすべての有料 Claude プランに公開され、Docs、Sheets、Slides 内で Claude によるファイル編集が可能になった。同時に公開された3種類の beta connectors は、Claude の会話から Google ファイルを作成・編集する機能を提供する。

Claude は、すべての有料プラン向けに Claude for Google Workspace の public beta を公開し、Google Docs、Sheets、Slides connectors の beta 版も同時に提供した。ファイルのサイドバーから操作する方法と、Claude の会話から Google ファイルを作成・編集する方法の2つを利用できる。公式説明によると、サイドバーは現在のファイルと選択されたテキスト、セル、スライドを読み取り、内容を直接変更できる。Docs では部分的な書き換えや書式変更に加え、採用または却下できる提案カードで変更を提示できる。Sheets では数式、pivot tables、標準のグラフ、シート追加に対応し、Python で処理したデータを書き戻すこともできる。Slides では既存のレイアウトとテーマを使ってスライドを生成し、要素の重なり、スライド外へのはみ出し、読みにくいテキストを確認できる。

公式によると、初期設定の Ask before edits モードは変更のたびに承認を待ち、Accept all edits モードは処理を続けて変更を適用する。Claude アカウントでログインすると、サイドバーでアカウント内の models、connectors、skills を利用できる。Enterprise プランの Compliance API、CMEK、OpenTelemetry audit export もアドオンに適用される。アドオンは Google Workspace Marketplace からインストールし、Extensions > Claude > Open Claude で開く。管理者は Google Admin console からドメイン全体または指定グループに配布できる。会話からファイルを編集するには対応する connectors を有効にする必要があり、Team と Enterprise プランでは owner または primary owner による事前の有効化が必要となる。ファイルへのアクセスは既存の Google 共有権限に従い、対応する構成では会話の横のパネルにファイルを開ける。

原文を読む →

谷歌のDocsとクラウドストレージが.mdファイルにネイティブ対応、リアルタイムの編集・コメントが可能に

产品应用

谷歌のDocsとクラウドストレージが.mdファイルにネイティブ対応、リアルタイムの編集・コメントが可能に

Google Docs と Google Drive に Markdown のネイティブサポートが追加され、.md ファイルを直接開き、編集し、コメントできるようになった。2026 年 10 月 5 日から提供が始まり、一部のユーザーは最大 15 日待つ可能性がある。

Google は 2026 年 10 月 5 日から、Google Docs と Google Drive に Markdown のネイティブサポートを順次提供しており、一部のユーザーは最大 15 日待つ可能性がある。.md ファイルを開くと、クリック可能なリンクや構造化された表を含むレンダリング済みの内容を直接表示でき、リアルタイムで編集やコメントができる。事前に別の形式へ変換する必要がないという説明は原文にはない。公式によると、この機能は AI Agent による文書の共同編集を可能にし、Gemini Notebook とも同期できる。Google 社員の Chandu Thota は、Markdown を人間と AI Agent の間の共通言語と表現した。

原文を読む →

ElevenLabsが対話型Agentの専門家Architectを発表

产品应用

ElevenLabsが対話型Agentの専門家Architectを発表

ElevenLabs は、ElevenAgents に組み込まれた Architect を Alpha 版として公開した。音声やテキストで AI Agent を作成・改善でき、公式説明によると、数千件の会話を分析し、構築とシミュレーションテストによる検証を終えた変更案を提示する。

ElevenLabs は ElevenAgents Architect をリリースし、Alpha 版として公開した。ユーザーは ElevenAgents 内で、音声やテキストによる会話を通じて AI Agent を作成・改善できる。この機能は Claude、Claude Code、ChatGPT、Cursor、Grok Bot からも呼び出せ、Agent のコンテキスト全体を引き継げる。公式説明によると、Architect は ElevenAgents のすべての設定オプションを把握し、知識ベース、prompt、ワークフロー、音声設定、procedures、guardrails、ツール、シミュレーションテストのベストプラクティスを扱う。会話記録を分析して問題の根本原因を特定し、変更を提案できるほか、数千件の会話からチームが見落としている可能性のある改善点を探せる。提示する各提案はすでに構築済みで、シミュレーションテストで検証されているという。

原文を読む →

Claude Codeのクラウドセッション実践ガイドが公開

技术与洞察

Claude Codeのクラウドセッション実践ガイドが公開

claude.dev は Claude Code のクラウドセッションガイドを公開し、独立したマシンでの並列タスクとプランの課金ルールを説明した。掲載された3タスクは16秒以内に順次開始され、最初の開始から87秒で全て完了し、クラウドマシンには別料金がかからない。

claude.dev は Claude Code のクラウドセッション実践ガイドを公開し、タスクの分離、開始方法、利用制限を説明した。原文には公開日の記載がない。同サイトの説明によると、各タスクには独立した仮想マシンが割り当てられ、リポジトリが新しいブランチにクローンされ、環境設定も済んだ状態となり、成果は pull request にできる。セッションは claude.ai/code、Claude mobile app、Desktop app、terminal、Slack から開始できる。Pro、Max、Team、Enterprise プランにはクラウドセッションが含まれ、マシンの別料金はないが、Claude Code の利用枠を共有する。一部の組織では所有者による事前の有効化が必要となる。ガイドではサンプルの Node API リポジトリで、不安定なテスト、古い API ドキュメント、logger の文字列連結を処理する3つの並列タスクを検証した。16秒以内に開始され、それぞれ61、65、72秒稼働し、最初の開始から87秒で全て完了した。各セッションは最初にプロンプト内のファイルからリポジトリを再構築しており、この工程は各実行時間の約3分の1から半分を少し超える割合を占めた。

原文を読む →

SierraがMeta、Stripe、沃尔玛などと個人向けAgentのオープン標準を共同開発

技术与洞察

SierraがMeta、Stripe、沃尔玛などと個人向けAgentのオープン標準を共同開発

Sierra は Meta、Stripe、ウォルマートなどと Personal Agent Protocol を共同開発し、ユーザーの許可に基づく個人 Agent と企業のやり取りを定める。誰でも実装できる標準で、公式には v0.1 仕様の公開を予定している。

Sierra は、Meta、Genesys、Instinct、Rocket、Shopify、Stripe、ウォルマートと、オープン標準 Personal Agent Protocol を共同開発すると発表した。原文には発表日が記載されていない。公式によると、この標準は認証を扱い、ユーザーが個人 Agent のアクセス権限を決め、企業が操作範囲を設定して活動を把握できるようにすることを目的としている。やり取りは企業のウェブサイトから始まり、Agent はサービスと接続方法を見つけた後、ユーザーに代わってゲストセッションを開始し、商品在庫や返品ポリシーを確認できる。アカウントへのアクセス時には、ユーザーは企業のページでログインするか、個人 Agent 用に設定済みの認証情報を使い、読み取り専用または書き込み権限を選択できる。セッションは OAuth に基づき、チャネルをまたいでログイン前後のやり取りを保持する。企業はウェブサイト、API、自社の Agent を接続経路として提供できる。この標準は誰でも実装でき、公式には v0.1 仕様の公開、設計ワークショップの開催、reference implementation の提供も予定している。

原文を読む →

OpenAIがIroncladと提携、契約業務のワークフローでAI agentを訓練

技术与洞察

OpenAIがIroncladと提携、契約業務のワークフローでAI agentを訓練

OpenAI は Ironclad と協力し、契約ワークフローを AI agent の訓練・評価用の 11 タスクにまとめた。公式評価では GPT-6 Astra の平均スコアが GPT-5.6 Sol を 32% 上回ったが、結果はこれらの研究タスクに限られる。

OpenAI は契約管理ソフトウェア企業 Ironclad との研究協力を発表し、複雑な契約ワークフローを AI agent の訓練と評価に活用する。Ironclad は最初の協力企業となる。両社は法律、営業、調達に関わる 11 タスクを設定し、秘密保持契約の設定や調達承認フローの作成などを含め、各タスクを 8〜50 項目の基準で評価する。同社の説明によると、経験のあるユーザーが各タスクを完了するには平均 30〜40 分かかると推定されており、協力の目的は専門ソフトウェアを使って複雑な業務上の問題を処理するモデルの能力を高めることにある。

公式説明によると、GPT-6 Astra はこれらのタスクで訓練された最初のフロンティアモデルとなる。研究評価での平均スコアは GPT-6 Astra が 55.0%、GPT-5.6 Sol が 41.6% で、前者が後者を 32% 上回った。1 回の試行にかかる推定時間はそれぞれ 19.2 分と 37.0 分で、前者は後者より 48% 少なかった。OpenAI は、結果の対象が上記の 11 タスクに限られ、時間はシミュレーションによる推定であり、顧客が実際に節約した時間の測定結果ではないと説明している。OpenAI はまた、同様の研究協力への申請を少数のソフトウェア企業に呼びかけている。

原文を読む →

GitHubがAgentによる開発に向けてGitインフラを再構築

技术与洞察

GitHub は、開発者と AI Agent の並行作業による負荷に対応するため、Git インフラを再構築している。過去1年間で月間 Git イベント数は2182億から4733億に増え、新アーキテクチャの内部テストでは書き込みスループットが従来の最大35倍に達した。

GitHub は、開発者と AI Agent の並行作業を支えるため、プラットフォームの稼働を続けながら Git インフラを改修しており、ユーザーが既存のビルド方法を変更する必要はない。過去1年間で月間 Git イベント総数は2182億から4733億へと増え、従来の2倍を超えた。9月のコミット数は73.8億件で、1年前の5倍を超え、プッシュ数は前年同月比で4.9倍増加し、月間33.5億件となった。GitHub の説明によると、既存の Spokes アーキテクチャは永続化と読み取りのスケーリングを結び付けており、読み取りレプリカの追加が書き込みを遅くし、活動量の多いリポジトリの処理能力を制限している。改修後は、整合性が必要な参照更新だけを調整の対象とし、圧縮やガベージコレクションなどの保守処理をサービスの処理経路から外す。正本となるデータは Azure Blob Storage に保存し、トラフィックに応じて増減する軽量キャッシュノードで読み取り容量を提供する。内部ベンチマークでは、新アーキテクチャの書き込みスループットは従来の最大35倍となり、読み取り容量は独立して拡張できる。公式によると、この基盤の導入はすでに進んでおり、今後の連載記事でアーキテクチャの詳細を紹介する。

原文を読む →

SemiAnalysisの実測:AnthropicのサブスクリプションはOpenAIの約5倍の価値

技术与洞察

SemiAnalysisの実測:AnthropicのサブスクリプションはOpenAIの約5倍の価値

SemiAnalysis は、Tokenomics Model の購読者向けに AI サブスクリプションの監視ダッシュボードを公開した。OpenAI、Anthropic などを対象に、月額料金だけで価値を比べず、モデルと token 種類別の使用枠消費を実測する。

SemiAnalysis は、AI サブスクリプションの使用枠を追跡する Subscriptions Dashboard を Tokenomics Model の購読者限定で公開したが、原文には公開日の記載がない。対象は OpenAI、Anthropic、Meta、SpaceXAI、Cursor、Cognition、Z.ai、MiniMax、Moonshot。同社の説明によると、同じ月額 200 ドルの Claude プランでも、API 換算の価値はモデルとワークロードによって変わるため、月額料金だけでは判断できない。テストでは Input、Cache write、Cache read、Output をそれぞれ分離し、プロバイダーが課金対象とした token 数と使用量メーターの変化を記録する。そのうえで、メーターの目盛り間の完全な区間から使用枠の消費率を算出し、開始時と終了時の未完了区間は計算から除外する。記事はまた、プロバイダーが上限を公表して変更するだけでなく、使用枠の消費コストを変更して告知なしに上限を変える可能性もあるため、単発の測定では継続的な変化を捉えられないとしている。

原文を読む →

a16zの消費者向けAIトップ100ランキングに支出額ランキングが初登場

技术与洞察

a16zの消費者向けAIトップ100ランキングに支出額ランキングが初登場

a16z は第7回の消費者向け AI トップ100に、米国消費者の支出ランキングを初めて追加し、トラフィック順位では捉えられない製品を補った。サンプルでは支出上位10%が約半分の支出を占め、ChatGPT の米国有料購読者数は Claude または Gemini の3倍だった。

a16z は第7回の消費者向け AI トップ100の公開時に、YipitData が観測した米国消費者のカード支出データを使う支出ランキングを初めて追加した。新ランキングには、デスクトップアプリや既存のメッセージングプラットフォーム内の Agent など、ウェブ版とモバイル版のランキングに入っていない数十の事業者が含まれる。データは米国のサンプルパネルに限られ、全数調査ではない。従来のランキングは引き続き、Similarweb の月間訪問数でウェブ製品50件を、Sensor Tower の月間アクティブユーザー数でモバイルアプリ50件を選ぶ。今回初登場した製品は11件で、7回の中で最少だった。

サンプルデータに関する a16z の説明によると、支出上位10%のユーザーが観測支出の約半分を占め、これらのユーザーはコーディング、生産性、創作のためのツールを購入する傾向が強い。YipitData のパネルでは、ChatGPT の米国消費者の有料購読者数は Claude または Gemini の3倍で、米国の ChatGPT 購読者のうち Claude も購読している割合は8%にとどまる。Claude の消費者向け有料ユーザーの7.3%が月額100米ドルからの Max を選択している。Google と ChatGPT の対応する月額100米ドルの購読プランの割合は、それぞれ1.3%と1.1%だった。

原文を読む →

Nous ResearchがエージェントモデルのランキングHermes Indexを公開

技术与洞察

Nous ResearchがエージェントモデルのランキングHermes Indexを公開

Nous Research は Hermes Index を公開し、4 つの評価スイートの平均スコアとタスク当たりの平均コストでモデルの Agent 能力を示した。ページでは、25 カテゴリーにわたる 150 タスクを含む Hermes Bench も紹介し、採点時にタスク終了後のファイルと状態を確認すると説明している。

Nous Research は portal ページで Hermes Index のモデルランキングを公開し、Hermes Agent 内で実行する 4 つの評価スイートの結果を平均スコアとタスク当たりの平均コストに集約した。ページの説明によると、スコアが高いほど成績がよく、ユーザーは最大 4 モデルを選んで各評価スイートのスコアとコストを比較できる。スコアとコストのグラフで線上にある各モデルは、それよりコストが低いすべてのモデルをスコアで上回る。ページには Hermes Bench のテスト設定も掲載されている。150 タスクが 25 カテゴリーに分かれ、Hermes skills、調査、図表とアート、記憶、ツール使用、安全を扱う。各 Agent は実際のファイルがあるワークスペースからタスクを開始し、一部のタスクには追加の対話ターンが含まれる。採点器は最終的に残されたファイルと状態を確認する。

原文を読む →

WHOのアフリカチームがGoogle Earth AIでエボラウイルス曝露地域を迅速に特定

技术与洞察

WHOのアフリカチームがGoogle Earth AIでエボラウイルス曝露地域を迅速に特定

コンゴ民主共和国のエボラ流行中、WHOアフリカ地域事務局と現地の研究機関が Google Earth AI の2つの研究用プロトタイプを使用した。Google は、関連ツールがエボラのリスクにさらされる遠隔地のコミュニティを数分で特定するのに役立ったと説明している。

WHOアフリカ地域事務局のダカールにある緊急事態準備・対応拠点と、コンゴ民主共和国国立生物医学研究所(INRB)の疫学モデリング・情報部門(UMIE)は、同国のエボラ流行中に Google Earth AI の2つの研究用プロトタイプを使用した。原文には具体的な日付は記載されていない。Geospatial Reasoning agent は自然言語での対話による空間マッピングを支援し、planetary prediction engine は疾病の自律的な予測に使われる。Google によると、これらのツールは環境シグナル、衛星画像、移動データ、基盤モデルを組み合わせ、既存の保健情報を補完し、報告の不足を埋める。同社の Population Dynamics Foundation Model(PDFM)は、集計された検索トレンド、人口移動、環境パターンを統合する。関連する embeddings は、Google Maps Platform の Population Dynamics Insights を通じて Preview として商用提供されている。研究者は特定の用途について無料アクセスを申請でき、対象条件を満たす機関は GMP Public Programs を通じて Google Earth credits を申請できる。Google.org は、現地の検査と疾病監視の能力の更新を支援するため、INRB に資金も提供した。

原文を読む →

Opus 5.5 Agentが3日間で2種類の室温磁性半導体を発見

技术与洞察

Opus 5.5 Agentが3日間で2種類の室温磁性半導体を発見

Vals AI によると、90 を超える Claude Opus 5.5 Agent が 3 日間で数百回の量子力学シミュレーションをクラウド上で実行し、室温磁性半導体の候補を 2 種類抽出した。バンドギャップとスピン選別能力は、まだ実測されていない。

LLM 評価機関の Vals AI はブログで、90 を超える Claude Opus 5.5 Agent が 3 日間のクラウド計算で数百回の量子力学シミュレーションを実行し、スピントロニクスの記憶用途に向けた室温磁性半導体の候補を 2 種類見つけたと発表した。同機関の説明によると、両者は正味の磁気モーメントがゼロでありながら電子をスピンによって選別できる Luttinger 補償磁体に属する。既存材料の KV[Cr(CN)₆] は 1999 年に初めて合成され、その年の実測で磁気秩序が 376 K まで維持された。今回の計算では、バンドギャップは約 2.1 eV、両方のバンド端は同じスピンチャネルに位置すると予測された。もう一つの候補である YBaMnFeO₅ は新たに設計されたもので、予測バンドギャップは 2.35 eV、磁気秩序は約 420 K まで維持されるが、合成に必要な原子の市松模様状の配列が乱れやすく、作製が難しい可能性がある。Vals AI は、これらの結果は理想結晶に基づき、バンドギャップもスピン選別も実測されていないと強調した。次の段階は KV[Cr(CN)₆] の再合成と測定であり、全計算データとワンクリック検証プログラムは GitHub で公開済みである。

原文を読む →

米国防総省、Anthropicの全製品の使用停止を確認

行业动态

米国防総省は BBC に対し、Anthropic の全製品の使用を停止したと確認した。同省は以前、六か月以内の移行を求めていたが、複数の関係者によると、Claude はその後も情報分析や対イラン軍事作戦に使われ、同省のデータ基盤にも組み込まれていた。

米国防総省は BBC への回答声明で、Anthropic の全製品の使用を停止したと確認したが、具体的な停止日や遅延の理由は明らかにしなかった。Pete Hegseth 国防長官は以前、国家安全保障を理由に Anthropic をサプライチェーン上のリスクに指定し、使用終了までの期限を六か月と定めていた。対立の発端は、国防総省が Claude の安全上の制限を取り除き、軍が同社の AI 製品を無制限に利用できるよう求めたことだった。Anthropic は大規模監視と自律型兵器への懸念から拒否し、指定の撤回を求めてトランプ政権を提訴した。訴訟が続く間に、国防総省は Google、xAI、OpenAI などと契約を結んだ。

複数の関係者が BBC に説明したところによると、Claude は使用停止の声明が出る前も、研究、分析、情報収集、対イラン軍事作戦に使われ、Palantir が運営する Maven Smart System にも組み込まれていた。同システムは、国防総省が情報やその他のデータを整理する主要な基盤となっている。情報筋によると、分析担当者は Maven を通じて衛星画像やドローン映像などの視覚データを取得・整理し、Claude や他の large language models に処理させており、その用途には潜在的な軍事目標の特定も含まれていた。Georgetown の安全保障・新興技術センターの上級研究アナリスト Lauren Kahn は、Claude が Maven と深く統合されているため、短期間での除去は難しかったと述べた。Anthropic の広報担当者は、使用停止の声明についてコメントを控えた。

原文を読む →

AnthropicがClaude Startupsプログラムを拡大

行业动态

AnthropicがClaude Startupsプログラムを拡大

Anthropic は Claude Startups を拡大し、Claude を基盤に起業するチームに、最大 7,000 米ドル相当の製品とクレジット、最大 45,000 米ドル相当のツール割引とクレジットを提供する。申請資格は設立時期または資金調達時期によって決まる。

Anthropic は Claude Startups の拡大を発表し、Claude を基盤に会社を構築する、より多くの起業家に申請を開放した。公式説明によると、メンバーは最大 7,000 米ドル相当の Claude 製品とクレジットを受け取れる。特典には 1 年間の Claude Team plan、API credits、Anthropic Applied AI チームと交流する office hours が含まれる。新設の Claude Startup Stack は営業、デザイン、データエンジニアリングなどのツールを対象とし、メンバーは Claude を使って製品を構築する企業から、最大 45,000 米ドル相当の割引とクレジットを受け取れる。このプログラムは顧客開拓、技術的な問題への対応、起業家同士の交流も支援する。過去 5 年以内に設立された、または過去 2 年以内に資金調達を行ったスタートアップが申請対象となる。申請窓口は Claude Startups ページにある。

原文を読む →

OpenAIがChatとWorkの切り替え機能を統合する計画

前瞻与传闻

OpenAIがChatとWorkの切り替え機能を統合する計画

添付された YouTube 素材のタイトルは、OpenAI が Chat と Work の切り替えを統合する計画だとしている。ただし、本文はウェブページの設定コードのみで、計画の発表時期、適用日、主要な数値や、タイトルを検証できる製品説明は含まれていない。

添付された YouTube 素材は、OpenAI による Chat と Work の切り替え統合計画をタイトルに掲げているが、計画の発表時期や適用日は記載していない。読み取れる本文は YouTube ページの初期化と機能設定のコードであり、動画の原稿、製品発表、OpenAI の公式説明は含まれていない。そのため、この素材から裏付けられる内容はタイトルに記された統合計画に限られ、具体的な変更、対象範囲、展開日程、計画がすでに実施されたかどうかは確認できない。

原文を読む →

OpenAIが300億ドルの新たな資金調達に向けて協議中との報道

前瞻与传闻

関係者によると、OpenAI は 300 億ドルの資金調達に向けて協議しており、交渉に参加する UAE のファンドには MGX が含まれ、合計出資額は最大 100 億ドルが検討されている。BlackRock も参加を協議中で、調達の詳細は変更される可能性がある。

関係者によると、OpenAI は複数の UAE の投資ファンドおよび BlackRock と協議し、ChatGPT の開発元である同社への 300 億ドルの資金調達を目指している。UAE のファンドにはアブダビに本拠を置く MGX が含まれる。関係者の一人は、これらのファンドが投資家連合を組んで今回の資金調達に参加する計画で、合計出資額は最大 100 億ドルが検討されていると述べた。BlackRock は、この連合とともに参加する方向で協議している。情報を提供した関係者は匿名を条件としており、資金調達はなお進行中で、具体的な取り決めは変更される可能性があるとしている。

原文を読む →

DeepSeekが少なくとも800億元を調達か、腾讯と宁德时代が主導

前瞻与传闻

DeepSeekが少なくとも800億元を調達か、腾讯と宁德时代が主導

Bloomberg が関係者の話として報じたところによると、DeepSeek は少なくとも 800 億人民元の新たな資金調達を間もなく完了する。Tencent と CATL の出資確約額は上位にあり、署名済みのタームシートに基づく最終総額は 1000 億人民元近くになる可能性がある。

Bloomberg が関係者の話として報じたところによると、DeepSeek の新たな資金調達は間もなく完了し、調達額は少なくとも 800 億人民元となる。同社は当初、約 500 億人民元の調達を目指していたが、最新の AI モデルの公開後、出資需要が予想を上回った。署名済みのタームシートに基づくと、最終総額は 1000 億人民元近くになる可能性がある。Tencent と CATL は、このラウンドで出資確約額が上位にある投資家に含まれる。Bloomberg は、この資金調達が DeepSeek の計画する 2027 年初めの IPO に向けた布石になると報じている。詳細はまだ公表されておらず、Reuters によると、DeepSeek、Tencent、CATL はいずれもコメントの要請に直ちには回答しなかった。

原文を読む →

月之暗面が上場前の資金調達を完了、評価額は約500億ドルとの報道

前瞻与传闻

月之暗面が上場前の資金調達を完了、評価額は約500億ドルとの報道

Bloombergが関係者の話として伝えたところによると、月之暗面は上場前最後の私募資金調達を完了し、評価額は約500億ドルとなった。2027年第1四半期に香港でIPOを行い、最大50億ドルを調達する計画で、初期の意向確認会合は早ければ2026年10月に開かれる。

Bloombergは2026年10月6日、月之暗面が上場前最後の私募資金調達を完了し、評価額が約500億ドルとなったと関係者の話として報じた。同社は2027年第1四半期に香港でIPOを行い、最大50億ドルを調達する計画だ。報道によると、同社はすでに非公開で香港証券取引所に申請を提出しており、投資家の関心を探るための準備を始めている。初期の意向確認会合は早ければ2026年10月に実施される。今回の上場ではBank of Americaが全体の調整役を務め、CICC、Deutsche Bank、Goldman Sachsがスポンサー銀行を務める。

原文を読む →

可灵 AIが主幹事候補の投資銀行を選定か、香港IPOで少なくとも10億ドルの調達を計画

前瞻与传闻

Bloombergが関係者の話として報じたところによると、快手傘下の可霊 AIは引受銀行を選定し、香港でのIPOで少なくとも10億米ドルの調達を計画しており、中金、Goldman Sachs、UBSと準備を進めている。協議は継続中で、調達額や上場時期は変更される可能性がある。

Bloombergが関係者の話として報じたところによると、快手科技傘下の可霊 AI(Kling AI)は情報が伝えられた時点で引受銀行を選定済みで、香港でのIPOを準備しており、少なくとも10億米ドルの調達を計画している。原文の換算では約67.14億元に相当する。株式発行の準備に参加する銀行には中金公司、Goldman Sachs Group、UBS Groupが含まれる。関係者によると、協議は継続中で、調達額と上場時期は変更される可能性がある。可霊 AIは2024年に設立され、AI動画サービスを提供し、商業化を進めている。同社が実施した資金調達ラウンドの規模は28億米ドルで、原文の換算では約188.01億元に相当し、投資家にはAlibaba、Tencent、Baiduが含まれる。原文はまた、このラウンドの完了後、同社のプレマネー評価額を約150億米ドル、換算で約1,007.17億元としている。競合にはByteDance傘下のSeedanceに加え、同じく香港でのIPOを計画する生数科技とPixVerseが含まれる。

原文を読む →