Claude Code 主宰者が、多層防御により Claude はプロンプトインジェクションの脅威をほぼ解決したと発言
技术与洞察
Claude Code の主宰者 Boris Cherny 氏は、Anthropic がモデル、ディテクター、意図分類器の多層防御により、プロンプトインジェクションの脅威をほぼ解決し、未知の攻撃の成功率はほぼゼロに低下したと投稿した。
Claude Codeの主創者であるBoris Cherny氏は投稿で、プロンプトインジェクションがユーザーとエージェントを攻撃する最も一般的な方法であり、初期のClaudeモデルがこれに影響を受けたと述べている。同氏は、Anthropicがこの種の攻撃を防ぐためにモデルを訓練することで、予想外に良い結果が得られ、実際にClaudeモデルを使用する際にこの脅威をほぼ解決したと指摘した。Boris氏はさらに、モデル、入力検出器、意図分類器を重ねるなどの多層防御により、未知のプロンプトインジェクション攻撃の成功率をほぼゼロに抑えることができると説明した。さらに、sshパスワードなどの資格情報にアクセスできないサブエージェントを使用して、信頼できないソースを読み取る方がより安全であると考えている。