Claude-Security-Report
2026年5月30日にresearch-fact-check v2.0で7項目検証を実施。総合判定: ✅ 合格。軽微な確認不足5件あり(research-fact-check v2.0 で7項目検証を実施)。
Claude Security レポート
Anthropic社製 脆弱性スキャンツール — パブリックベータ以降の総合評価
作成日: 2026年5月30日
調査対象: Claude Security(旧称 Claude Code Security)
対象期間: 2026年4月30日(パブリックベータ開始)以降
1. 製品概要
| 項目 | 内容 |
|---|---|
| 製品名 | Claude Security |
| 開発元 | Anthropic |
| 発表日 | 2026年4月30日(米国時間)/ 5月1日(日本時間) |
| ステータス | パブリックベータ(Enterpriseプラン限定) |
| コアモデル | Claude Opus 4.7 |
| アクセス方法 | claude.ai/security またはClaude.aiサイドバー |
| 前身名称 | Claude Code Security → 改名して Claude Security |
| Team/Maxプラン | 近日公開予定 |
1.1 位置づけ
Claude Securityは、コードベースをスキャンして脆弱性を特定し、ターゲットを絞った修正パッチを生成する防御型サイバーセキュリティ製品。従来のルールベース(パターンマッチング)の静的解析ツール(SAST)とは異なり、AIモデルがコードを「推論」することで、文脈依存の複雑な脆弱性を検出する。
Anthropicの内部Frontier Red Teamが、CTF大会参加、Pacific Northwest National Laboratoryとの共同研究、1年以上のストレステストを通じて培ったサイバーセキュリティ能力を、エンタープライズ顧客向けに提供することが目的。
2. 機能とワークフロー
2.1 スキャンフロー
リポジトリ選択 → スキャン実行(非同期) → 結果表示 → 修正提案 → PR生成 → マージ
- スキャン実行:
claude.ai/security→ "Start a new scan" → リポジトリ/ディレクトリ/ブランチを選択 - 推論ベース分析: セキュリティ研究者のようにコードを読み、データフローを追跡、コンポーネント間の相互作用を理解
- 多段階検証: 各検出結果を独立して検証し、誤検知をフィルタリング
- 結果出力: 深刻度、信頼度、影響範囲、再現手順、修正方法を記載
- 修正提案: "Create fix" → Claude Codeと連携してパッチ生成 → "Create PR" → 自動Pull Request
2.2 主な機能
| 機能 | 説明 |
|---|---|
| 文脈理解 | ファイル間のデータフロー追跡、ビジネスロジック理解 |
| 多段階検証 | 自己検証による誤検知フィルタリング、信頼度レーティング |
| パッチ生成 | 既存コードベースのスタイルに合わせた修正提案 |
| スケジュールスキャン | 定期的な自動スキャンによる継続的モニタリング |
| 却下理由の文書化 | 監査証跡の維持 |
| エクスポート | CSV / Markdown形式 |
| Webhook連携 | Slack、Jira等への自動通知 |
| スコープ指定 | 特定ディレクトリ/ブランチに限定したスキャン |
2.3 スキャンEffort(工数)レベル
Claude Securityではスキャン開始時にEffortレベルを2つの選択肢から指定できる。これはClaude Code CLIの5段階effort(low/medium/high/xhigh/max)とは別物で、Claude Security固有のスキャン深度設定である。
| Effortレベル | 英語表記 | 説明 |
|---|---|---|
| 普通 | Standard |
日常的なスキャン向け。標準的な推論バジェットで効率的に脆弱性を検出 |
| 拡張 | Extended |
より大きな推論バジェットを割り当て、深い分析を行う。広範囲のコードベースや複雑なデータフローの追跡に適する |
重要な特性:
- Claude Code CLIのeffort設定とは無関係 — Claude Security固有のUI設定
拡張を選択すると、スキャンにより多くの推論リソースが割り当てられるが、所要時間とトークン消費(=コスト)が増加する- スキャン開始時に**$600以上**の予約クレジット残高が必要(DeveloperIO実測レポートより)
- 実測コストの目安: 小規模スキャン(数百行)で約$7.50、所要時間約5分
- 結果は確率的(非決定的)— 同一コードベースでも実行ごとに異なる結果が出る可能性がある
- モデルはClaude Opus 4.7に固定(ユーザー側で変更不可)
設定画面の構成(5フィールド):
Repository— 接続済みOrgからドロップダウン選択Branch— スキャン対象ブランチScan scope— オプション(特定ディレクトリに限定可能。例:services/api/)Model— Claude Opus 4.7固定Effort— 普通(Standard)/ 拡張(Extended)
2.4 検出カテゴリー例
- インジェクション脆弱性(SQLi、コマンドインジェクション等)
- 認証・認可の不備(アクセス制御、JWT脆弱性等)
- クロスサイトスクリプティング(XSS)
- 安全でないデータフロー
- ビジネスロジックの欠陥
- 複雑なマルチコンポーネント脆弱性パターン
3. 精度・パフォーマンス評価
3.1 Anthropic公式主張
| 指標 | 数値 |
|---|---|
| 誤検知率 | 5%未満(多段階検証レイヤー経由) |
| 従来SAST誤検知率 | 30〜60%(比較対象) |
| CVD真陽性率 | 90.8%(外部レビュー1,900件中1,726件が有効確認) |
| OSSゼロデイ発見数 | 500件以上(Claude Opus 4.6使用) |
| 発見候補総数 | 23,019件 |
※注: CVD(協調的脆弱性開示)の数値はGlasswing/Mythosプロジェクトの成果であり、Claude Securityパブリックベータの実測値とは異なる。
3.2 実機スキャンレポート — Hedgineer(Daniel Avila, 2026年5月2日)
スタンドアローン製品「Claude Security」を実際のリポジトリで走らせた唯一の公開レポート。
内部モノレポをスキャンした結果:
- 発見された脆弱性パターン:
- 信頼されない入力 + ファイルシステム — パストラバーサル、シンボリックリンクdereference、正規化欠如
- 信頼されない入力 + サブプロセス/シェル — argvインジェクション、
eval文字列、python -cリテラル(シェルメタ文字・フラグインジェクションリスク) - 開発ツール/CIスクリプト内の問題 — ローカル開発サーバーやCI検証スイートの問題(通常のパターンマッチャーが無視する領域)
- シークレット取り扱い —
DEBUGログ内の資格情報、緩いファイルパーミッション、キャッシュされたシークレット
- 重要な洞察: 「単一行のバグではなく、関数間を跨ぐ複数ステップの脆弱性チェーンを特定した」
- UIの印象: 「リンターというより、エンジニアリングチームがリポジトリ上で作業しているように見えた。スキャンがリポジトリの実際の内容によって形作られている」
- ⚠️ 定量データなし — 発見数・精度・偽陽性率は未記載
🔗 Hedgineer: Claude Security — A Step-by-Step Walkthrough
3.3 再現性テスト — Cobalt.io(2026年)
非決定性(non-determinism)に関する重要な実測データ:
- ある研究者が同一スキャンを50回実行 → 結果が大きく変動
- 回によっては全問題をキャッチ
- 回によっては複数の問題を見逃す
- 根本原因: LLMの非決定性 — 毎回異なるアプローチで問題に接近
- トークンコストも非決定的 → 財務予測・ROI追跡が困難
- 標準化の欠如: 従来のSAST/DAST/IASTのような標準手法、カバレッジチェックリスト、ピアレビュープロセスが存在しない
「AIによるスキャン製品が崩れ始めるのは再現性の部分である。LLMの性質上、これらのツールは非決定的 — 実行するたびに問題に異なるアプローチを取り、異なる結果を生み出す可能性がある」
Cobalt Coreの追加データ:
- エリートペンテスターの54%がキャリア中にゼロデイを発見
- 最高リスクの欠陥を見つける最も効果的なモデルとして、AI自動テストを支持するのはわずか1%
- PTaaS(Pentesting as a Service)をゴールドスタンダードと見なすのは58%
🔗 Cobalt.io: Where Claude's Security Scanning Falls Short
3.4 LLMスキャン実測 — Checkmarx Zero(Opus 4.6ベース)
Claude Security専用ではないが、同系列のLLMスキャン能力の実測データ:
| テストケース | 設定 | 結果 | 教訓 |
|---|---|---|---|
| CGifライブラリ(~2,000 LoC) | 集中的コンテキスト | オーバーフローを特定成功 | 小規模・焦点を絞ったコンテキストでは有効 |
| n8n本番リポジトリ | 単一広範プロンプト | トークン90%消費、8件中真陽性2件(精度25%) | ガイドなしのフルスキャンは非効率・ノイズ多い |
| コンテキスト限定スキャン | 歴史的CVE情報・特定モジュール提供 | 精度・関連性が大幅改善 | ターゲットを絞ったコンテキストが必須 |
結論: 「LLMは強力な補完ツールだが、今日のセキュリティツール(SAST、DAST、IaCスキャナー)や専門家の代替にはならない。大規模コードベースでは単一プロンプトでのスキャンは回避し、コードベースをレビュー可能な単位に分解すること」
🔗 Checkmarx Zero: Learning About LLM-Based Zero-Day Hunting
3.5 業界の考察 — ISACA / Penligent
ISACA Now Blog(Richard Beck & Keith Bloomfield DeWeese):
- カバレッジと証明: セキュリティチームは全脆弱性インスタンスの検出証明を必要とするが、AI推論はこれを保証できない
- 規制受容: 規制当局がAI生成の発見事項を受け入れるか不明
- チェーン反応リスク: 「提案された修正が、認可ロジックや信頼境界を変更し、別の脆弱性を導入する可能性」
- 「未来はAIがAppSecを置き換えることではない。成熟したセキュリティエンジニアリングプラクティスの中にAIが組み込まれることである」
Penligent / Anthropic Cybersecurity Tool 2026:
- 「もしコードレビューシステムにリポジトリを渡し、インターネットに公開された本番環境が安全かどうかを尋ねるなら、それは間違った質問をしている」
- 重要ポリシー: 「AIセキュリティレビューの最大のリスクは偽陽性ではない。偽の自信(false confidence)である」
- 「発見は一度なら簡単。大規模コードベースで信頼でき、データフローを理解し、信頼できる修正を提供する — そこが生のモデルコマンドがまだ解決していない部分」
3.6 Snyk CTOの懸念
Danny Allan(Snyk CTO)の指摘:
「非決定的メカニズムを決定的ガードレールとして使うことへの懸念だ。そして定義上、これらは非決定的である」
- コンプライアンス/監査において再現可能な結果が必須の状況での課題
- 「コードを生成するものにコードをセキュアさせてはいけない。一度幻覚を見たら、また幻覚を見る可能性が高い」 — 自己検証が同じ盲点を継承するリスク
- Anthropic自身も「AI-assisted scanningが一般的になり、世界のコードの相当部分がAIによってスキャンされる」と予測
3.7 開発者コミュニティの声
- Reddit: 「一般的なセキュリティレビューを依頼すると、曖昧なアドバイスや幻覚が多い。特定の観点に絞ると精度が上がる」
- DevelopersIO実機レポート: 小規模コードベース(数百行)は5分以内で完了、コスト約$7.50。結果は確率的(非決定的)
- Anthropic公式: 数百社が2ヶ月の限定プレビューでテスト、「スキャンから修正済みパッチまでを1セッションで完了」
4. 利用企業からのフィードバック(公式発表)
| 企業 | コメント要約 |
|---|---|
| DoorDash | 深い脆弱性を正確に特定、ワークフローに直結 |
| Snowflake | 新しい高品質な知見を発見、影響前に問題を解決 |
| Column | コードのビジネスロジックを理解、スキャンから修正まで数クリック |
| Yuno | スキャン品質が決め手、実在する問題を迅速に届ける |
| Hebbia | チケットではなくPRに。数日ではなく数分で脆弱性を閉じた |
※これらはAnthropicが公開しているカスタマー引用であり、独立検証された数値ではない。
5. 協調的脆弱性開示(CVD)実績
2026年5月22日時点:
| 段階 | 数値 |
|---|---|
| 発見候補 | 23,019件 |
| 外部セキュリティ企業がレビュー | 1,900件 |
| 有効と確認(真陽性率 90.8%) | 1,726件 |
| メンテナーに報告 | 1,596件 |
| メンテナーが承認 | 1,451件 |
| アップストリームでパッチ適用 | 97件 |
| セキュリティアドバイザリ公開 | 88件 |
代表的な発見例:
- nginx CVE-2026-27654(ヒープバッファオーバーフロー / High)
- wolfSSL CVE-2026-5446(ARIA-GCM Nonce Reuse / High)
- wolfSSL CVE-2026-5503(heap buffer overflow / High)
6. コスト
| 項目 | 内容 |
|---|---|
| 予約クレジット | スキャン開始時に**$600以上**の残高が必要 |
| 実測コスト | 小規模スキャンで約**$7.50** |
| 課金モデル | コードベースの規模と頻度に比例 |
| 請求表示 | AdminダッシュボードでClaude Code Reviewと統合表示 |
7. セキュリティ懸念点と制限事項
7.1 データガバナンスリスク
「スキャン結果は『王冠の宝石』として保護すべき。漏洩すると攻撃者に事前構築済みの攻撃計画を提供することになる」
— Reddit r/ArtificialInteligence 議論より
- Webhook、インサイダー、エクスポートCSVの管理が重要リスクポイント
- スキャン結果は機密情報として厳格なアクセス制御が必要
7.2 技術的制限
- ソースコードのみを対象(コンパイル済みバイナリ、サードパーティ製パッケージ、コンテナは対象外)
- サプライチェーン脅威(依存関係、CI/CD改ざん、シークレット漏洩)に対応できない
- ランタイムテスト不可(実行時の認可テストにはDASTが必要)
- 自社所有コードのみスキャン可能(第三者コードは利用規約で禁止)
7.3 コンプライアンス
- LLMの確率的な性質により、結果は非決定的
- EU CRA、NIS2、PCI DSS等は決定論的で再現可能な証拠を要求
- コードはAnthropicのクラウドで処理される(データ主権の懸念)
7.4 Claude Code自身の脆弱性
Check Point ResearchがClaude Code自体に脆弱性を発見:
- CVE-2025-59536(CVSS 8.7、コードインジェクション)
- CVE-2026-21852(CVSS 5.3、APIキー漏洩)
- いずれもAnthropicが修正済み
8. パートナーエコシステム
テクノロジーパートナー(Opus 4.7を既存プラットフォームに統合):
- CrowdStrike、Microsoft Security、Palo Alto Networks、SentinelOne、TrendAI、Wiz
サービスパートナー(エンタープライズ導入を支援):
- Accenture、BCG、Deloitte、Infosys、PwC
TrendAI(TrendMicro)はAnthropicとパートナーシップを結び、AIネイティブセキュリティを推進。
9. 業界のコンセンサスと戦略的提言
9.1 レイヤードアプローチ
SAST/SCA(ベースライン)
→ Claude Security(セマンティック深度・未知脆弱性)
→ DAST(ランタイム検証)
→ 人間による最終確認
Claude Securityは従来のSASTを置き換えるものではなく、補完するものという位置づけが業界標準の見方。
9.2 業界からの提言まとめ
- 置き換えるな、補完せよ: AIスキャンを補助レイヤーとして統合。ベースラインカバレッジには決定論的ルールエンジンを維持
- ガバナンスとランタイムに投資: AIの盲点をカバーするため、ポリシー強制、データフロー追跡、ランタイム保護にシフト
- 文脈が王: 盲目的なリポジトリ全体スキャンではなく、特定の脅威モデルと既知のアーキテクチャリスクにAIを向ける
- 検証してコード化せよ: AIの知見は仮説として扱え。手動で検証し、真陽性をSemgrep/Falco/OPAルールに変換
- 偽の自信を警戒せよ: 最大のリスクは見逃しではなく、AIの出力を過信すること。テスト証拠なしの修正は受け入れるな
9.3 「サイバー検証者の法則」
「AIが500の新しいロジック欠陥を見つける → 人間が450を失格させる → 50をSemgrep/Falco/OPAルールにコード化する。AIがフロンティアを押し広げる。決定論的ルールが前線を守る。」
10. 総括
10.1 現状評価
Claude Securityは2026年4月30日のパブリックベータ開始から約1ヶ月。方向性は正しいが、エンタープライズ級の信頼性・一貫性・精度を得るにはまだ初期段階。
独立した定量評価は極めて少なく、実機スキャンを公開したレポートはHedgineerの1件のみ(定量データなし)。再現性テスト(Cobalt.io)では同一スキャン50回で結果が大きく変動し、LLMの非決定性が確認された。Checkmarxの実測ではガイドなしフルスキャンの精度は25%に留まったが、コンテキスト限定で大幅に改善。Anthropicの公式CVD数値(90.8%真陽性)は別パイプライン(Glasswing/Mythos)によるもので、パブリックベータの実測値とは直接比較できない。
10.2 今後の注目ポイント
- Team/Maxプランへの展開時期と機能差異
- 独立した第三者機関によるベンチマーク評価の公開
- 誤検知率の実測値(Anthropic主張の5%未満の検証)
- パートナー統合(CrowdStrike、Wiz等)の実装状況
- 非決定論性の改善(同一コードでの結果一貫性)
10.3 結論
Claude Securityは「AIによるセマンティック脆弱性検出」という新しいカテゴリを開拓した製品だが、現時点では**「SASTの置き換え」ではなく「補助レイヤー」**として位置づけるのが現実的。精度とコスト効率の両面で改善余地が大きく、今後の成熟度に注目が必要。
付録: AIセキュリティスキャナー全般のベンチマーク知見(Rafter 2026)
※本セクションはClaude Security単体ではなく、AIセキュリティエージェント全般に適用可能な評価方法論のまとめ。
- 開発者は誤検知率が10〜15%を超えるとツールを使わなくなる(Google Static Analysis Team)
- AIエージェントの精度はモデル自体よりスキャフォールディング(枠組み)で決まる
- GPT-4単体: 15-40%精度
- GPT-4 + エージェント基盤: 70-85%精度
- 同一コードで3〜5回実行した際の**一貫性(非決定論性)**がCI/CD信頼性の鍵
- 従来のOWASP BenchmarkやNIST JulietはAI評価に不適切。LLMがテストパターンを暗記している可能性
- ベンダー報告の数値は合成テストスイートに基づくものが多く、自社コードベースで実行したベンチマークのみが信頼できる
🔗 Rafter: Benchmarking AI Code Security Agents (2026)
参考ソース
- Anthropic公式: Claude Security is now in public beta
- SecurityWeek: Anthropic Unveils Claude Security to Counter AI-Powered Exploit Surge
- DevelopersIO: Claude Securityで脆弱性のスキャン→検知→修正まで一気通貫にやってみた
- ZDNet Japan: Anthropic、「Claude Security」を発表
- Anthropic Red Team: CVDダッシュボード
- Pulse 2.0: Anthropic Launches Claude Security In Public Beta
- Hedgineer: Claude Security — A Step-by-Step Walkthrough(スタンドアローン実機スキャン)
- Cobalt.io: Where Claude's Security Scanning Falls Short(再現性テスト)
- Checkmarx Zero: Learning About LLM-Based Zero-Day Hunting(LLMスキャン実測)
- ISACA Now: Does Claude Have a Security Problem?(規制・コンプライアンス考察)
- Penligent: Anthropic Cybersecurity Tool in 2026(技術分析)
- Snyk: Why Anthropic Launching Claude Code Security Is Great News for the Industry
- Context Studios: Claude Code Security vs Static Analysis 2026
- DerScanner: Claude Code Security vs. Traditional SAST
- StackHawk: Claude Code Security vs /security-review: What to Know(製品比較)
- heise online: Claude Security — Anthropic launches vulnerability scanner for businesses
- BuildFastWithAI: Claude Security: How It Works, What It Finds, vs Snyk
- The New Stack: Anthropic's Claude Security emerges from closed preview