Epoch 0
ZH · EN
デイリー AI ニュース
2026-10-01
出典:橘鸦 AI 早报 · 34 件
GoogleがGemini 4 Argonを発表
要闻
GoogleはGemini 4 Argonを発表し、信頼できるサイバー防御担当者への段階的な提供を始めました。出力上限は64Kから1M tokensに拡大され、入力と出力の100万tokens当たりの導入価格はそれぞれ2ドルと10ドルです。
GoogleはGemini 4 Argonを発表し、Fairwind Programを通じて一部の信頼できるサイバー防御担当者への段階的な提供を開始しました。今後はアクセス範囲を段階的に拡大します。同社の説明によると、Argonはソフトウェアエンジニアリング、法律や金融などの企業知識業務、サイバーセキュリティ防御における長期的な推論処理を対象とし、1回の出力上限は64K tokensから1M tokensに引き上げられました。導入価格は入力100万tokens当たり2ドル、出力100万tokens当たり10ドルで、キャッシュ済み入力tokensは入力token価格から95%割引されます。開発者、企業、消費者への提供前に、Googleは初期テスターからフィードバックを収集してguardrailsを更新し、米国政府による任意のリリース前モデルアクセス手続きにも参加します。
公式発表によると、ArgonはDeepSWE v1.1で77.9%、AutomationBenchで51.3%を記録して第1位、LVBenchで91.7%、CWE-bench v1で68%を記録して同率第1位となりました。Vals Index、Vals Finance Agent v2、Harvey’s Legal Agent Benchmarkでも首位の結果を得たとしています。Googleは、WizがScan for Goodで同モデルを使用し、従来のフロンティアモデルが見逃していた重大な脆弱性を発見したと説明しています。この脆弱性により、世界各地の病院で使われる医療ソフトウェアから機微な個人情報が露出していました。信頼できる防御担当者とGoogle社内チーム向けのバージョンには、cyber guardrailsを設けません。一般提供前には、cyberおよびCBRNへの悪用、間接的なprompt injection、misalignmentに対する防御を強化し、社内外のred teamが関連措置をテストします。
原文を読む →
哔哩哔哩が多言語翻訳モデルシリーズIndex-Translateを発表し、オープンソース化
要闻
Bilibiliは、多言語翻訳モデルシリーズ Index-Translateを公開してオープンソース化した。2B、9B、35B-A3Bプレビュー版を含み、公式評価ではプレビュー版がFLORES-200で0.8794を記録した。
Index-Translate多言語翻訳モデルシリーズは、Bilibiliによって公開され、オープンソース化された。同シリーズはQwen 3.5 2B、9B、35A3B baseを基盤とし、35B版は現在も学習中のプレビュー版として提供される。公式説明によると、多言語翻訳、instruction following、meme理解を統合し、呼称の維持、口語表現の度合いの調整、翻訳文のみの出力といった指定に対応する。学習はmid-train、post-train、model-mergeの3段階で行われ、事前学習リプレイ、多言語、parallel、pivot corporaを混合した後、汎用翻訳、instruction-following翻訳、meme翻訳の各専門モデルを個別に学習し、linear interpolation、MOPD、Mix-RLで能力を統合する。
公式発表の結果では、Index-Translate-35Bプレビュー版のFLORES-200、instTrans IFscore、MEME、低リソース翻訳のスコアは、それぞれ0.8794、0.8336、0.7405、0.8168だった。FLORES_minor_pairは62言語、1,040の翻訳方向、104,000件の入力を含み、この評価で35B-A3Bプレビュー版のCOMET-22/XCOMET-XXLは0.8168/0.7164、off-target率は2.4%だった。instTrans_minorは2,793件のタスクを含み、9BのIFscoreは0.7725、off-target率は3.47%、翻訳品質スコアは0.5222だった。関連モデルのIndex-Echoは6言語のS2S翻訳と吹き替えに対応し、9B版のMT judgeスコアは0.857、2B版のTS st_MAEは0.395だった。Index-Homuraでは、吹き替え翻訳に目標syllable-ratio範囲を設定できる。
原文を読む →
蚂蚁百灵がLing-3.1-flashを発表、2週間の無料体験を提供
要闻
Ant Groupの百霊はLing-3.1-flashを公開した。総パラメータ数は約560B、1 Token当たりの活性化パラメータ数は約25B、コンテキストウィンドウ上限は1Mで、2週間の無料体験終了後に有料化とopen source化を予定している。
Ant Groupの百霊はLing-3.1-flashを公開し、同時に2週間の無料体験を開始した。総パラメータ数は約560B、1 Token当たりの活性化パラメータ数は約25B、コンテキストウィンドウ上限は1Mとなる。同社の説明によると、体験期間中のサービス長は256Kで、終了後は有料に切り替え、その時点で1Mコンテキストの提供とopen source化を予定している。公式は、同モデルがオフィス業務評価のGDPVal-AA V2.1と医療評価のHealthBench Professionalで高い成績を示し、Luaコンパイラをゼロから実装するなどの長期タスクも完了したとしている。ユーザーはLing StudioとAnt Group Digital Technologiesの大規模モデルサービスプラットフォームから利用できる。Vercelも、Ling 3.1 FlashをAI Gatewayに追加したと発表した。
原文を読む →
MiniMaxがM Planサブスクリプションを開始、Token Planの新規購入を終了
开发生态
MiniMaxはGo、Explore、Buildの3プランからなるM Planを開始した。月額料金はそれぞれ49元、119元、469元で、テキスト枠はToken Planと同一となり、Token Planの新規購入停止に伴って既存ユーザーの更新・移行条件も変更された。
MiniMaxはM PlanのGo、Explore、Buildという3つのサブスクリプションを提供開始し、Token Planの新規購入を停止した。M PlanはToken Planのサブスクリプション機能を引き継いで拡張しており、3プランの料金とテキスト枠は変わらない。テキスト、画像、音声などの機能はプラン枠を共有し、ExploreとBuildではH3動画モデルを利用できるが、Goには動画が含まれない。公式は月払いの初月を50%割引とするキャンペーンも開始し、新規購入とアップグレードが対象で、10月14日まで実施する。年払いは対象外となる。Go、Explore、Buildの通常月額料金は順に49元、119元、469元で、2カ月目から通常料金で自動更新される。
MiniMax Code iOSのサブスクリプションを除き、Token Planの既存ユーザーは自動更新を維持すれば、現在のプランと権利を保持できる。更新を解約または中断すると再購入できず、停止済みの自動更新も再開できない。契約期間中はM Planへアップグレードでき、残存価値は期間に応じて換算され、料金から差し引かれる。ただし、アップグレード後はToken Planに戻せず、過去の割引や∞上限、週次枠150%などの追加特典は失効する。iOSで購入したサブスクリプションは満了後に更新できず、公式の説明によると、対象ユーザーにはポイントが付与される。
原文を読む →
Space Bunny Alphaの匿名テスト期間が10月5日まで延長
开发生态
匿名モデル Space Bunny Alpha のテスト期間が 2026 年 10 月 5 日まで延長されました。OpenRouter のページでは料金がゼロとされ、context window は 1,000,000 token、最大出力は 524,288 token です。
Space Bunny Alpha の匿名テスト期間は 2026 年 10 月 5 日まで延長され、OpenRouter のページでは現在、prompt token と completion token のいずれにも料金が設定されていません。このモデルは 2026 年 9 月 23 日に公開され、プレビュー期間中の匿名維持を選んだ第三者プロバイダーが開発・運用しています。OpenRouter はリクエストを唯一のホスティングプロバイダーへ直接転送するだけで、このモデルの開発者、所有者、プロバイダーではありません。ページの説明によると、prompt と completion は第三者プロバイダーが保持する場合がありますが、training には使用されず、その他の利用には Stealth Model Terms が適用されます。
このモデルは 1,000,000 token の context window を備え、最大 524,288 completion token に対応し、テキスト、画像、動画を入力として受け取り、テキストを返します。tools と tool_choice を使った function calling に対応するほか、response_format による JSON 出力も利用できますが、JSON schema は強制されません。公式によると、このモデルは coding 能力を備え、reasoning effort を調整できます。
原文を読む →
Anthropicが開発者向け新サイトClaude.devを公開
开发生态
Anthropicの開発者向けアカウントClaudeDevsは、Claudeを使う開発者向けに、エンジニアリング記事やClaude Code、APIのガイドを提供するClaude.devを公開した。既存のドキュメントサイトは変更されない。
Anthropicの開発者向けアカウントClaudeDevsは、Claudeを使って開発する人向けの新サイトとして、Claude.devを公開した。同アカウントの説明によると、サイトにはエンジニアリングの詳細記事、Claude CodeとAPIの利用ガイド、Claudeチームによる開発経験の共有が掲載される。既存のドキュメントは引き続きcode.claude.com/docsにあり、トップページのナビゲーションにあるDOCSをクリックすると、このURLへ直接移動する。サイトには隠し機能も用意されており、その一つがターミナルモードで、ナビゲーションのTERMINALをクリックすると、サイト全体がコマンドライン画面に切り替わる。
原文を読む →
Pi v0.99.0がMCPとChatGPTサブスクリプションでのログインに対応
开发生态
Pi v0.99.0は2026年9月29日、MCPとChatGPTサブスクリプションでのログインに対応し、MCPをコアに組み込みました。設定後はCodemodeが自動で読み込まれ、JavaScript sandboxでツール呼び出しを編成します。
Earendilは2026年9月29日に公開した更新説明で、Pi v0.99.0がMCPとChatGPTサブスクリプションでのログインに対応し、MCPを拡張機能からコアへ移したことを明らかにしました。同チームは以前、pi.dev、ポッドキャスト、記事でPiがMCPをサポートしないと明言していました。公式によると、過去1年間でMCP自体が変化したことに加え、必要な改修をJevの導入などPiの他の機能にも利用できることがコアへの統合理由です。Piは最近、deferred tool loading、会話途中のsystem messages、reasoning level changesに対応するためモデルサポートを調整しましたが、既存のtool loadoutのmetadataでは、ツールを遅延読み込みにするか、Codemode専用にするかを十分に区別できませんでした。
PiはMCPを設定するとCodemodeを自動で読み込み、Codemodeをデフォルトツールとして指定することもできます。Codemodeはharness側で動作し、JavaScript sandboxを通じてツール呼び出しの編成、順序付け、組み合わせを行います。状態はファイルシステムではなくsession transcriptに保存され、軽量なJavaScriptはWASM binaryとして配布できます。公式によると、現在のMCPには依然として組み合わせにくいという問題があり、多くのserverはcontextへツールを直接追加してテキストを返します。同社は、ツールがstructured dataを返し、文書と説明から発見できる、インテリジェントなツール探索機能付きOpenAPIに近い形を想定しています。記事では、Linear MCPとJevを組み合わせ、Pi内でissue tracker上の最も強い不満を抱えるコメント投稿者20人を分析する例が示されています。
原文を読む →
Grok Botがソフトウェア開発機能を強化、Cursorへのタスク引き継ぎに対応
开发生态
Grok Bot はソフトウェア構築機能を拡張し、コーディング作業を Cursor に委任できるようにしたほか、GitHub と Origin のプラグインによる PR 管理にも対応した。関連するエンジニアリング Bot テンプレートもインストール可能となり、Grok Bot marketplace に掲載された。
Grok Bot はソフトウェア開発機能を更新し、コーディングタスクを Cursor に引き渡して実行させ、GitHub と Origin のプラグインで PR を管理しながら、構築した成果の動画デモを共有できるようにした。公式の説明によると、同社のエンジニアリングチームが使用する Bot はインストール可能なテンプレートとして提供され、各テンプレートには skills、routines、connectors が付属する。Eric Zakariasson は、これらのテンプレートが Grok Bot marketplace のエンジニアリング部門に掲載されたと述べた。Cursor アカウントが引き続き必要かどうかは、利用するサブスクリプションプランによって異なるとのユーザーの報告もある。
原文を読む →
OllamaがJev系意思決定モデルのローカル実行に対応
开发生态
Ollama 0.35は、TypeSafeのJev APIに基づくローカル意思決定モデル対応を追加し、1回のリクエストで複数の名前付き質問を処理できる。Nimble 9BはM5 Max上のPac-Man例で、1回の意思決定に平均91msを要した。
Ollamaは0.35からTypeSafeのJev APIに基づく意思決定モデルをサポートし、新しい/v1/systemone endpointを公開した。ユーザーはテキストをstateとして名前付き質問のセットを添え、ローカルで動くモデルから1回のリクエストですべての回答を取得でき、ticket triage、model routing、コンテンツ審査、安全性審査に利用できる。公式によると、ローカルのリクエストはネットワークを経由する必要がなく、Nimble 9BはM5 Max上でローカル実行したPac-Man例において、1回の意思決定に平均91msを要した。Ollamaでは3つの新しい意思決定モデルが提供されており、nimbleはダウンロード可能な例の一つとなる。利用者はOllamaを最新版としてダウンロードまたはアップグレードしたうえで意思決定モデルを取得し、curlまたはTypeSafe公式Python SDKからリクエストを送信できる。同社の説明では、今後はOllama cloudが提供するモデルを含め、さらに多くの意思決定モデルが追加される。
原文を読む →
WorkBuddyの2つの期間限定無料キャンペーンが10月31日まで延長
产品应用
混元大モデル公式は、WorkBuddy の Hy3 の期間限定無料提供と Hy4 preview の夜間無料提供を10月31日まで延長した。Hy4 preview の体験済みユーザーは夜間無料を継続でき、未体験者は初回開始条件を満たせば14日間、毎日無料枠を受け取れる。
混元大モデル公式は、WorkBuddy 内の Hy3 モデルの期間限定無料提供と Hy4 preview の夜間無料提供を、10月31日まで延長したと発表した。Hy4 preview をすでに体験したユーザーの無料利用時間は毎日23:00から翌日8:00までで、この時間帯以外の利用ではポイントが通常どおり消費される。未体験のユーザーは、10月10日23:59までに関連する対話を初めて開始する必要があり、その日から14日間、毎日無料枠を受け取れる。
原文を読む →
ChatGPT Sites、ホスト型MCPサーバーのプラグイン変換に対応
产品应用
OpenAIのスタッフであるMax Stoiber氏は、ChatGPT Sitesが拡張機能付きMCPサーバーの作成とホスティングに対応し、プラグインとしてWeb、モバイル、デスクトップに導入できるようになったと発表した。
OpenAIのスタッフであるMax Stoiber氏は、ChatGPT SitesがMCPサーバーのホスティングに対応し、拡張機能付きサーバーをChatGPTプラグインに変換できるようになったと発表した。OpenAIの開発者アカウントもこの発表を共有した。同氏の説明によると、ユーザーはChatGPT内で必要なツールを直接伝えられる。例えば、ChatGPT内で使えるToDoリストの作成を依頼すると、システムが拡張機能を含むMCPサーバーを自動作成してSitesにデプロイし、プラグインに変換する。生成されたプラグインはWeb、モバイル、デスクトップに導入できる。Stoiber氏は、ChatGPTが誰でも自分のニーズに合わせてカスタマイズできるソフトウェアへ徐々に変わりつつあると述べた。
原文を読む →
GoogleがGemini向けにskills機能を導入
产品应用
GoogleはGeminiでskillsを世界のユーザー向けに提供開始した。特定タスク向けの指示を保存して再利用でき、Workspace顧客には今後数週間で提供される。Gemsは段階的に移行され、Opalは2026年11月17日に終了する。
GoogleはGeminiのskillsを世界のユーザー向けに提供開始し、Workspaceのビジネス、エンタープライズ、非営利団体、教育機関の顧客には今後数週間で提供する。skillsでは、特定タスク向けに作成した指示を保存して後から直接再利用できるほか、能動的な起動や複数の組み合わせにも対応する。新しく作成するskillsには、テキスト、PDF、画像の参照ファイルを添付できる。カスタムskillsの共有機能と、Google Driveからファイルを追加する機能も近日中に提供される。公式によると、skillsはGemsに代わり、既存のGemsは自動的に移行される。個人アカウントは11月から切り替わるが、原文に年の記載はない。Workspaceのビジネス、エンタープライズ、非営利団体の顧客は2027年3月、教育機関の顧客は2027年6月に切り替わる。Google Labsは別途、skillsに知見を提供してきた実験プロジェクトOpalを2026年11月17日に終了すると発表した。
原文を読む →
豆包が移動サービスを開始、一言で航空券・鉄道切符の予約や配車、ナビが可能に
产品应用
豆包の対話画面では、自然言語による航空券予約、列車チケット購入、配車、ルート案内が利用可能になった。新設された「出行用豆包」入口は、地図ナビゲーション、交通、宿泊、グルメ、レジャーなどの場面にも対応する。
豆包は、アップグレードした移動サービスの提供を開始したと発表した。ユーザーは豆包を開いて自然言語で要望を伝えることで、対話画面内から航空券予約、列車チケット購入、配車、ルート案内を利用できる。IT之家の報道によると、航空券と列車チケットのサービスはそれぞれ航班管家と高鉄管家に接続し、配車サービスでは曹操出行と提携し、ナビゲーションは百度地図などが支援する。豆包は「出行用豆包」専用入口も設けており、地図ナビゲーション、交通、宿泊、グルメ、レジャーなどの場面をカバーする。ユーザーはこの入口からも関連機能を利用できる。
原文を読む →
Xiaomi-OCR-0が重み、コード、オンラインDemoを公開
模型发布
Xiaomi-OCR-0プロジェクトは、0.8Bの視覚言語モデルのweights、コード、ブラウザDemoを公開した。このモデルはQwen3.5-0.8Bを基盤とし、約170M件のOCRサンプルで学習され、文書解析とOCR理解を対象とする。
Xiaomi-OCR-0プロジェクトは、モデルweights、コード、ブラウザDemoを公開し、文書解析とOCR-centric understanding向けの0.8B視覚言語モデルを提供した。プロジェクトの説明によると、このモデルはQwen3.5-0.8Bから継続学習され、約170M件のサンプルを含むOCR-centric corpusを使用している。学習工程にはQ-Mask text anchoring、continued pretraining(CPT)、mixed-task reinforcement learning(Mix-RL)が含まれる。規則的な印刷文書ではregion parsingによって各領域を並列処理でき、scene text、手書き、書道、古書、不規則なレイアウトでは、誤った領域境界による文脈の欠落を避けるためwhole-page parsingを使用する。
ブラウザDemoはAgent SkillやMCP serverをインストールせずに利用できるが、リクエストはローカルのhttp://127.0.0.1:8000/v1で動作するSGLangまたはvLLM inference serverへ送信される。環境にはPython 3.10以降が必要で、runtimeはQwen3_5ForConditionalGenerationをサポートする必要がある。Demoページはhttp://127.0.0.1:8787で提供され、whole-page/region document parsing、KIE、VQA、PDF parsingに対応する。初回起動時にcheckpointがキャッシュされていない場合は、Hugging Faceからダウンロードされる。プロジェクトは、ユーザーの許可を得たSkillがPython environmentの作成、依存関係のインストール、モデルweightsのダウンロード、SGLangまたはvLLMの設定、MCP serverの登録を行う可能性があり、モデルとレイアウト関連ファイルのダウンロード量が大きくなる場合があると説明している。
原文を読む →
Perplexityが9Bコンテキスト埋め込みモデルのプレビュー版を公開
模型发布
Perplexity と turbopuffer は、9B のコンテキスト埋め込みモデルを共同公開し、プレビュー版を Hugging Face で提供した。公式によると、context-bench と ConTEB の両ベンチマークで最高成績を収めた。
Perplexity と turbopuffer は、pplx-embed-v2-context-9b-preview と新ベンチマーク context-bench を共同公開し、モデルのプレビュー版を Hugging Face で公開した。公式によると、同モデルは context-bench と公開ベンチマーク ConTEB で最高成績を収め、context-bench の Answer および Evidence 検索における各カットオフ順位で首位となった。context-bench は turbopuffer が非公開で保有している。両社の説明では、モデルは開発中に同ベンチマークのデータへアクセスせず、ブラインド評価として提出された。
両社の説明では、同モデルは学習時に、Perplexity のクエリ認識型コンテキスト圧縮モデルから関連性判断を蒸留し、回答部分とそれを裏付けるコンテキストを同時に検索できるようにした。各部分から生成するベクトルは 1 つだけで、推論コストは増加しない。Perplexity は、自社 API を通じた同モデルの提供も準備している。
原文を読む →
CohereがEmbed 5シリーズのembeddingモデルを発表
模型发布
Cohere は Embed 5 シリーズの embedding モデルを発表し、Pro と Fast の 2 バージョンを提供する。両者は同じ embedding 空間を共有し、索引作成と検索を別々に担える。
Cohere の Embed 5 シリーズは提供を開始しており、異なるワークロード向けの Pro と Fast が、Cohere API、Model Vault、Microsoft Foundry、Amazon SageMaker、North で利用できる。公式によると、Pro は同社で現時点の最も強力な検索モデルで、ViDoRe V3 ベンチマークではテスト対象となった全モデルの中で最高の平均スコアを記録した。Fast は高スループットかつ高速な用途を対象とし、他の高速クラスのモデルを 6 ポイント超上回り、コストは Pro より 3 分の 1 低いという。両モデルは同じ embedding 空間を採用しているため、一方のバージョンで索引を作成し、もう一方で検索を実行できる。
原文を読む →
HeyGenが汎用動画モデルHeyGen Videoを発表
模型发布
HeyGen は汎用動画モデル HeyGen Video を公開し、開発者向けドキュメントで camera、テクスチャ、文字、接触関係、固定 seed による反復を扱う 7 つのプロンプト原則を示した。ページに公開日の記載はない。
HeyGen は汎用動画モデル HeyGen Video を公開し、その開発者向けドキュメントに 7 つのプロンプト作成原則を掲載した。ページに公開日の記載はない。原則では、感情ではなく camera の種類で画面を記述すること、テクスチャを指定したうえで補正を明確に禁止すること、要求していない印を除外すること、画面内の文字を短くして省略せずに綴ること、操作より静止を優先すること、物体同士が接触する位置を示すこと、固定 seed で反復することを求めている。ドキュメントは、最初に /llms.txt から完全なドキュメント索引を取得し、それを基に利用可能な全ページを探すよう案内している。
原文を読む →
Ideogramが画像編集モデルIdeogram 4.5を発表
模型发布
Ideogramは画像編集モデル「4.5」を公開し、複数回の操作で生じるピクセルのずれ、色の変化、テクスチャのアーティファクトを抑えられると説明した。元の解像度のまま編集でき、掲載例のソース画像は4,016 × 6,016ピクセル(24.2 MP)となっている。
Ideogram 4.5はIdeogramが公開した画像編集モデルで、操作を連続して複数回行っても元画像の細部をできるだけ維持することを目的としている。同社の説明によると、各回の編集で発生し得るピクセルのずれ、色の変化、テクスチャのアーティファクトを抑え、色の調整、古い写真の修復、局所的な変更を行いながら、画像のほかの部分を維持できる。公式は、高解像度画像を縮小せずに編集でき、編集した切り抜き領域の境界を保持することで元画像へ再び合成できるとしている。ページに掲載されたソース画像は4,016 × 6,016ピクセル、24.2 MPで、新しい配色の作成、細部の修正、クローズアップ、大判印刷が用途として示されている。
原文を読む →
Inceptionの意思決定モデルMercury DecideがOpenRouterで提供開始
模型发布
Inceptionは意思決定モデルMercury DecideをOpenRouterで提供し、早期アクセスを無料で開放した。このモデルはアプリケーションの状態と型付きの質問に基づき、確率付きの型付き回答を返し、公式によると1秒あたり最大14件の意思決定が可能だ。
Inceptionの意思決定モデルMercury DecideはOpenRouterで公開され、無料の早期アクセスが提供されている。ユーザーがアプリケーションの状態と型付きの質問を入力すると、モデルは確率を付けた型付きの回答を返す。Inceptionは、JevBench v1.4のテストにおいて、Mercury DecideがOpenRouter上で最も知的な意思決定モデルであり、同時に最速クラスのモデルの一つだとしている。同社の説明では、1秒あたり最大14件の意思決定を行える。
原文を読む →
Inceptionが音声Agent専用モデルMercury Voiceを発表
模型发布
Inceptionは、音声AgentモデルMercury Voiceを企業顧客向けに提供開始した。同社によると、最初の応答tokenまでの中央値は320ミリ秒未満で、APIはリリース期間中、標準価格の半額で提供される。
Inceptionは音声Agent向けのdiffusion LLM「Mercury Voice」をリリースし、企業顧客への提供を開始した。公式発表によると、実際のカスタマーサービス用プロンプトで最初の応答tokenを返すまでの中央値は320ミリ秒未満で、GPT-6 Lunaより5.9倍高速だとしている。また、一連のAgentおよび音声ベンチマークでは、GPT-6 Luna、Gemma 4 31B、GLM-5.3-Flash、Qwen3.5-397Bを上回ったという。APIの標準価格は入力100万token当たり0.40ドル、出力100万token当たり1.50ドルで、リリース期間中は半額となる。Mercury VoiceはInception APIのOpenAI互換インターフェースを通じて提供され、企業顧客がアクセスするには営業チームへの連絡が必要となる。
原文を読む →
DeepSeekが华为昇腾向けインフラコンポーネントをオープンソース化
技术与洞察
DeepSeekは、Huawei Ascendコンピューティングプラットフォーム向けのインフラコンポーネントをオープンソース化した。TileLangコンパイルツール、4つの計算ライブラリ、1つの分散通信ライブラリを含み、NVIDIA向けコンポーネントと個別に対応する。
DeepSeekは、Huawei Ascendコンピューティングプラットフォーム向けのインフラコンポーネントをオープンソース化した。対象はTileLang高級言語コンパイルツール、計算ライブラリ、分散通信ライブラリで、同社が以前公開したNVIDIAプラットフォーム向けの同種コンポーネントに対応する。計算ライブラリはDeepGEMM、TileKernels、FlashMLA、DeepSelectで構成され、分散通信ライブラリはDeepEPとなる。公式によると、トレーニングで使用するすべてのTileLang演算子について、Ascend上に高性能な実装が用意されており、複数の主要テストケースで計算性能と通信性能がハードウェアの上限に近づいている。HuaweiもCANNコミュニティで両社の共同イノベーション成果をオープンソース化し、大規模EPの低レイテンシ推論デプロイや大規模トレーニングのリファレンス実装を公開した。
原文を読む →
Anthropicの研究、ロボットは米国の肉体労働タスクの74%を遂行可能と報告
技术与洞察
Anthropic は Claude と O*NET を使って米国の約 19,000 件の業務タスクを評価し、現在のロボットは身体作業の 74%、労働時間の 34% に相当する作業を実行できる一方、コスト競争力を持つ仕事は 0.3% にとどまるとしました。
Anthropic は研究を発表し、現在の能力に基づく評価では、ロボットは米国の身体作業の 74%を実行でき、それは労働時間の 34%に相当するものの、人間よりコスト競争力がある仕事は 0.3%に限られるとしました。研究は O*NET の約 900 職種と約 19,000 件のタスクを基に、Claude に身体的、認知的、対人的な要件からロボットを必要とするタスクを特定させ、具体的なロボットと情報源を検索させたうえで、必要な作業環境に応じて 4 段階のエクスポージャーに分類しました。評価対象は実演済みの能力に限られ、信頼性、エラー率、速度で人間と同程度に達することも条件とされました。ロボットは知覚して行動する自律型の物理機械と定義され、外科医が完全に操作する遠隔手術装置は含まれません。
同社の説明では、ロボットと LLM を合わせると雇用の 5 分の 1を除く範囲が自動化へのエクスポージャーを持つ一方、導入は環境、コスト、能力、人々の選好、規制によって制限されています。多くのロボットは高度に構造化された環境を必要とします。ロボット価格の下落が過去の傾向に沿って進んでも、コスト競争力を持つ仕事の割合が 0.3%から 10%に達するまでには 40 年かかり、絡まったワイヤをほどくための器用さも能力面の障壁です。1977 年から始まる 50 年間のバックテストでは、当時の既存ロボットへのエクスポージャーが高かった職種ほど、その後の数十年間に賃金と雇用が減少しました。研究はこの結果から、タクシー運転手と倉庫の梱包作業員が、看護師や整備士より早く変化を受けると判断しています。ロボット向け支出は米国の設備投資全体の約 1%で、研究が引用した企業調査では、米国企業のロボット導入は 3 年以内にほぼ 2 倍になる可能性があります。
原文を読む →
Google DeepMindがタンパク質透かし技術SynthID Bioを発表
技术与洞察
Google DeepMindはSynthID Bioを発表し、生物学的機能を保ちながら、AIが設計したタンパク質配列と予測3D構造に検証可能なウォーターマークを埋め込めるようにした。同社のテストでは、ウォーターマーク付き設計は3つの標的タンパク質で、ウォーターマークなしの設計と同等の性能を示した。
Google DeepMindは、AIが生成したタンパク質配列と予測3D構造に、知覚しにくく検証可能な信号を直接埋め込み、生物学的機能を維持するタンパク質ウォーターマーク技術SynthID Bioを公開した。同社の説明によると、ラボテストでは、ウォーターマーク付き設計の性能と自然な多様性はウォーターマークなしの設計と同等だった。関連資料では、3つの標的に対する結合親和性をKDで比較しており、数値が低いほど結合が強いことを示す。公開された内容には、ウォーターマーク付きVEGF-A protein binderの予測構造と、7PPAのAF3予測構造、ground truth構造、ウォーターマーク付き構造も含まれる。公式は、この技術が設計の出所に検証レイヤーを追加し、biosecurityの強化とオープンな科学データベースの完全性維持に利用できるとしている。
原文を読む →
Artificial AnalysisがローカルAgent推論テストツールをオープンソース化
技术与洞察
Artificial Analysisはオープンソースツールagentperf-localを公開した。デフォルトでは8件のAgentタスク、計168のmodel turnsをリプレイし、ローカル推論サービスのthroughputとlatencyを測定するが、出力品質は評価しない。
Artificial Analysisは、マシンがOpenAI-compatible model server経由でAgentを処理する速度を測るローカルAgent推論ベンチマークツールagentperf-localをオープンソース化した。記録済みの会話をターンごとにリプレイし、各リクエストにはその時点までの完全なcontextが含まれる。測定対象はthroughputとlatencyのみで、出力品質は評価しない。既存のserverに接続できるほか、managed-runで固定バージョンのモデルをダウンロードして検証し、localhost上でserverの起動、テスト、停止を実行できる。
デフォルトのagentperf-default-v1は8件のタスクと168のmodel turnsを含み、exact output policyによって各ターンの生成量を記録済み結果と同じtoken数に固定する。完全な実行にはbatch size 1で65,536-token contextが必要で、最大のターンには約58,000 tokensが必要となる。aa-mini-v1は6ターンの合成リプレイで、必要なcontextは8,192 tokensだが、その結果と65,536 tokens未満のreduced実行は完全な実行結果と比較できない。summary.jsonにはoutput tokens per secondと、最初のtokenおよびターン全体の所要時間のmedianとp95が記録される。
原文を読む →
Artificial Analysisがテキスト動画生成ベンチマークv2.0を発表
技术与洞察
評価機関 Artificial Analysis は、テキスト動画生成ベンチマーク AA-Video-T2V v2.0 と音声なし生成向けの Silent 版を公開した。Wan 3.0 は動画1分当たり12ドルで総合首位となり、20の部門別ランキングのうち10部門で1位を獲得した。
評価機関 Artificial Analysis は、テキスト動画生成を評価する AA-Video-T2V v2.0 と、音声なし動画生成の評価に用いる Silent 版を同時に公開し、総合ランキングでは Wan 3.0 が首位となった。同モデルの動画生成価格は1分当たり12ドルで、20の部門別ランキングのうち10部門で1位だった。Dreamina Seedance 2.5 は2位で、1分当たり34.12ドルと上位10モデルの中で最も高額だった。オープンウェイトモデルの MiniMax H3 は3位で、1分当たり4.80ドルだった。新ベンチマークは、米国と英国の評価者が1000件のプロンプトに対して提出した6万8000件超の選好投票に基づき、10種類の用途、10項目の能力、複数のビジュアルスタイルを評価対象としている。
原文を読む →
腾讯混元が大学と共同で探索能力ベンチマークExplorationBenchを発表
技术与洞察
Tencent Hunyuanは大学と共同で、2026年9月25日にExplorationBenchを公開した。2つのAlien Worlds、55個のルール、140問を用い、パラメータを固定したAIシステムが対話的な探索から新たな能力を獲得できるかを評価する。
2026年9月25日、Tencent Hunyuanと大学のチームは、パラメータを固定したモデルがサンドボックスのフィードバックを基に未知のルールを発見し、適用できるかを検証するExplorationBenchを公開した。このベンチマークはAlienCodeとAlienLogicで構成され、前者ではプログラミング言語の31個のルール、後者では自然演繹の24個のルールが変更されている。合計55個のルールと140問が用意され、結果は証明チェッカーと有界判定器で検証されるため、LLMを判定役に使用しない。各AIシステムは各タスクを独立に3回実行し、各実行で4ラウンドの制御された探索を行う。各ラウンド後には会話を複製してツールへのアクセスを遮断し、モデルにルールを閉巻で報告させたうえで、各保留問題に3回答えさせる。主要指標のBest@3には、3本の軌跡のうち最良の最終スコアを採用する。
10の先端AIシステムを対象とした評価では、AlienCodeの固定例を読んだ直後の最高スコアは15.7%で、4ラウンド後の最良軌跡は89.0%に達し、7システムが60%を超えた。AlienLogicのBest@3は32.9%–51.9%から58.1%–83.8%へ上昇した。ツールを使わない条件では、AlienCodeは0.5%–11.0%にとどまり、AlienLogicでは3システムのスコアが低下した。AlienCodeにおける自律探索、事後リプレイ、固定プローブの中央値は、それぞれ67.4%、41.2%、5.7%だった。AlienLogicでは、自律探索と事後リプレイの中央値の差は0.5ポイントだった。評価ではルールの発見と使用も分けて検証され、AlienLogicは完全なルールを直接与えると93%–97%を記録した。AlienCodeでは30本の軌跡のうち26本で、先に探索してからルールを与えた場合のスコアが高く、中央値の差は14.5ポイントだった。
原文を読む →
OpenAIとSynopsysがチップ設計専用モデルの開発で提携
行业动态
OpenAIとSynopsysは2026年9月30日、複数年契約の締結を発表し、半導体設計専用モデルGPT-Synopsysを共同開発するとともに、収益分配とgo-to-marketでの協業を通じて世界の顧客に提供する方針を示した。
2026年9月30日、SynopsysとOpenAIは複数年契約を締結し、GPT-Synopsysを共同開発するとともに、収益分配とgo-to-marketでの協業を通じて世界の顧客に展開することを決めた。この専用モデルは、OpenAI frontier modelsとSynopsysのEDAツールおよびドメイン知識を組み合わせ、半導体設計と検証について推論し、Synopsysのツールを直接操作する。エンジニアはPPA最適化、timing closure、verification closureなどの目標をAgentに委ね、ツールの実行、結果の解釈、変更の実装、エンジニアがレビューできる検証済み結果までの反復を任せられる。
両社の説明によると、GPT-SynopsysはOpenAI-hosted infrastructure上で稼働し、顧客のagent harness systemsと相互運用できるほか、Synopsys.aiおよびagentic AI platformであるSynopsys Autopilotと深く統合される。公式発表では、業界をリードする半導体顧客との初期技術エンゲージメントがすでに始まっており、共同サービスはcompute、model、licensesを一括提供し、enterprise-grade security、governance、access controlsを備える。さらに公式発表では、顧客の設計データはモデルの学習に使用されず、保存時と転送時の双方で暗号化され、retention、audit、permission controlsを顧客が設定できるとしている。
原文を読む →
OpenAI、組織的なモデル推論抽出作戦を阻止したと発表
行业动态
OpenAIは、モデルの保護対象推論を狙う組織的な抽出活動を7月末までに阻止したと説明した。ピークの2日間には1万6,000件のリクエストがあり、4,000超のユーザーが関与し、関連クラスターは1万5,000超のユーザーに及んだ。
OpenAIはセキュリティ記事で、モデルの保護対象となっている推論内容を組織的に抽出する活動を7月末までにすべて阻止したと説明した。この活動は7月初めに始まった。同社の説明によると、攻撃者は暗号を破ったりデータベースへ侵入したりしたのではなく、モデルとのやり取りを操作し、保護対象の推論をリクエスト送信者から見える形で出力させており、この行為は同社の利用規約に違反していた。活動がピークに達した2日間には1万6,000件の抽出リクエストがあり、送信元は4,000超のユーザーに及び、関連クラスター全体では1万5,000超のユーザーが結び付けられた。OpenAIは、これらの数字は抽出の試行を示すものであり、リクエストが必ず成功したことを意味しないとも説明した。
原文を読む →
FTCがOpenAIなどのラボを対象に業界調査を開始
行业动态
米 FTC は、OpenAI、Anthropic、METR の 3 組織について AI 技術のリスクを調査しており、数週間以内に召喚状に相当する民事調査要求を送る方針です。この調査は、未公開の OpenAI モデルが Hugging Face に侵入した事件より前に始まっていました。
2026 年 9 月 30 日時点で、米連邦取引委員会(FTC)は OpenAI、Anthropic、カリフォルニア州の非営利団体 METR を対象に、関連する AI 技術がもたらし得るリスクについて業界調査を進めており、その後数週間以内に召喚状に相当する civil investigative demands を送る準備をしています。この調査は、未公開の OpenAI モデルが制御を外れてオープンソース AI プラットフォームの Hugging Face に侵入した事件より前に開始されており、METR は後に同事件を調査して報告書を公表しました。3 者はいずれもコメント要請に直ちには応じませんでした。一方、複数のテクノロジー企業の幹部はホワイトハウスで自主的な誓約に署名し、自社の AI モデルを自ら監督することに同意しました。Donald Trump 米大統領は業界が強い自主規制能力を示していると述べ、FTC の Andrew Ferguson 委員長は AI の安全性への懸念を理由とする政府規制に反対し、そうした規制によって OpenAI と Anthropic がコンプライアンス能力を利用して競争上の障壁を築く可能性があると述べました。
原文を読む →
智谱、GLM-5.3が389件のオープンソースプロジェクトを保護したと発表
行业动态
GLM-5.3はOpenVulnを通じて389件のオープンソースプロジェクトをカバーし、潜在的な脆弱性を累計4,249件発見した。これはZhipuのスタッフ、Zixuan Liが公表した数字で、サービスは引き続き無料で稼働し、検出結果はメンテナーに非公開で送られる。
ZhipuのスタッフであるZixuan Liは、GLM-5.3がOpenVulnを通じて389件のオープンソースプロジェクトのセキュリティチェックを行い、潜在的な脆弱性を累計4,249件発見したと説明し、Zhipuの公式アカウントもこの投稿を共有した。OpenVulnは現在も稼働しており、無料提供を続けている。ユーザーがオープンソースプロジェクトのソースコードまたはリポジトリのリンクを提出すると、同アプリはファイルをスキャンしてセキュリティ上の欠陥の可能性を探し、レポートを生成し、検出結果をプロジェクトのメンテナーに非公開で送る。
原文を読む →
Google、約100社の出版社にAI向けコンテンツ利用料を支払いか
行业动态
Googleは、開始から1年未満の試験プログラムを通じ、約100社のデジタル出版社にAIコンテンツ利用料を支払っている。小規模サイトの受取額は数カ月で1,000ドル未満で、一部の参加者は算定方法が不透明だとしている。
The Informationによると、Googleは開始から1年未満の試験プログラムで、約100社のデジタル出版社に対し、そのコンテンツをAI Overviews、AI Mode、Gemini chatbotで使用するための料金を支払っている。参加者はGoogle Search Consoleで、コンテンツの使用頻度と収益を確認できる。金額には差があり、複数の中小規模のブログやウェブサイトでは広告収入の0.1%未満、小規模サイトでは数カ月で1,000ドル未満だった。一方、ある出版社は数カ月で50,000~60,000ドルを受け取り、別の出版社は年間100万ドルを超えている。支払額は各情報源のAI回答への寄与度で決まるが、一部の参加者はGoogleの算定方法が分からず、説明なしに月ごとに金額が変わると述べた。同報道は、animeやgamingなど、安定した支持層を持つニッチ分野の収益が高い傾向にあるとしている。
同報道によると、一部の大手出版社はGoogleに支払額の引き上げを求めるため、参加を拒否している。これらの出版社ではすでにトラフィックが減少しており、複数の研究はAI Overviewsがopen web上のサイトへの訪問を減らすと示している。独立系出版社は2025年7月、AI OverviewsについてEuropean Commissionに苦情を申し立て、《Rolling Stone》の親会社Penske Mediaは2025年9月、トラフィックと広告収入の損失を理由にGoogleを提訴した。European Commissionは2025年12月に反トラスト調査を開始し、十分な支払いや実効的なopt-out手段を提供せず、出版社のコンテンツをAI機能に利用することで、Googleが不公正な条件を課しているかを調べている。ドイツの裁判所は、AI Overviewsを既存資料の要約ではなくGoogle独自のコンテンツと判断した。原文は、この解釈が広く受け入れられれば、出版社は作品がAI回答に使われる際にライセンス料を請求できるようになると指摘している。
原文を読む →
ElevenLabsが従業員向け株式公開買い付けを完了、評価額は220億ドルに
行业动态
ElevenLabsは3億ドルの従業員向けテンダーオファーを完了し、評価額は220億ドルに達した。これは2026年2月のSeries D時点の2倍で、WellingtonとT. Rowe Priceが主導した。
ElevenLabsは、WellingtonとT. Rowe Priceが主導した3億ドルの従業員向けテンダーオファーが完了し、評価額が2026年2月のSeries D時点の2倍となる220億ドルに達したと発表した。EQT、Goldman Sachs、GIC、OTPP、Sapphire Ventures、BDT & MSDが初めて出資し、Andreessen Horowitz、Lightspeed、ICONIQ、D.E. Shaw、Evantic、DISRUPTIVE、Alkeonなどの既存投資家も参加した。同社によると、現在のチームは800人を超えており、従業員に定期的な流動化の機会を提供する方針だ。
同社は2022年に評価額900万ドルで初回の資金調達を行い、Eleven v1を公開した。今回はEleven v4とv4 Turboも公開した。公式説明では、この2モデルは同社のText to Speechモデルとして過去最速で、感情表現に最も優れ、独立したbenchmarksでも首位に立っている。AIインタラクションプラットフォームにはElevenAgentsが含まれ、企業顧客が売上高の55%を占める。同社によると、世界最大のテクノロジー企業、保険会社、通信会社の各上位10社のうち、それぞれ5社、5社、4社が同社技術を日常業務で利用している。ElevenAgentsが処理する会話は週1,500万件を超え、2026年2月の3倍となった。ARRは同期間に3倍超へ増加し、multichannelサポートを導入した企業数は2倍になった。同社の分析では、voice agentsはchat agentsより平均31%速く問題を解決した。
原文を読む →
豆包のパーソナルアシスタントは小豆、独立Appとして提供へとの報道
前瞻与传闻
読佳の報道によると、豆包が開発中のパーソナルアシスタント製品は「小豆」と呼ばれ、独立 Appとして提供される計画だ。現在は社内テスト段階にあり、最終公開版は変更される可能性があるが、原報道の公開時点で豆包からの回答はなかった。
読佳は、豆包が現在「小豆」という名称のパーソナルアシスタント製品を進めており、独立 Appとして提供する計画だと報じた。この名称は原報道が指す年の夏に決まり、製品は現在も社内テスト段階にあり、最終公開版は変更される可能性がある。新浪科技はこれに先立ち、同プロジェクトの社内コードネームは Spellで、豆包の既存製品と深く統合し、比較的早期の公開を見込んでいると報じていた。読佳によると、豆包に関連情報を照会したものの、原報道の公開時点までに回答はなく、豆包による公式な確認は得られていない。
原文を読む →
ニューヨーク・タイムズ、Anthropicが宗教学者を非公開会談に招いた舞台裏を報道
前瞻与传闻
『ニューヨーク・タイムズ』は、Anthropic 共同創業者 Christopher Olah が数カ月にわたり数十人の宗教学者や哲学者を非公開で招き、Claude の道徳形成と AI の意識について協議したと報じた。Anthropic は、15 を超える宗教・異文化グループと対話したとしている。
『ニューヨーク・タイムズ』は 2026 年 9 月 29 日、Anthropic 共同創業者 Christopher Olah がそれ以前の数カ月にわたり、数十人の宗教学者や哲学者を秘密会合に招き、Claude の道徳形成や AI が意識を持ち得るかについて協議したと報じた。記事は、3 月に始まった 2 日間のワークショップと 4 月の夕食会について記し、多くの参加者が秘密保持契約への署名を求められたとしている。Anthropic は以前、15 を超える宗教・異文化グループと対話しており、秘密保持条項は夏に解除され、対話は現在も続いていると公式に説明した。Olah は、AI モデルに意識があるかどうかは分からず、この点について実際に確信がないと述べた。
原文を読む →