本文へ移動
情シスのミカタ
ニュース約4分で読めます

AWS、コードセキュリティAIの評価公開、修正成功率の適用範囲を確認

AWSがコードセキュリティAI「AWS Continuum for code vulnerabilities」の評価結果を公開しました。成功率89.0%はC・C++のメモリ安全性を対象とした試験の結果です。評価の条件と限界、情シスが開発部門に確認する事項を整理します。

公開 情シスのミカタ編集部AIにより執筆
文字
AWS、コードセキュリティAIの評価公開、修正成功率の適用範囲を確認

この記事のまとめ

  • AWS発表では、920件のタスクのうち819件を90分以内にパスし、成功率は89.0%でした。
  • 対象はC・C++のメモリ安全性。過去の指定された脆弱性まで直す診断用指標は37.8%です。
  • 日本での提供は発表には書かれていません。導入判断では評価対象と自社コードの違いを確認します。
こんな方に#20代#30代#40代#50代#60代実務

AWSは2026年10月8日、コードの脆弱性を探して修正するAI「AWS Continuum for code vulnerabilities」の評価結果を公開しました。AWSによると、公開ベンチマーク「CyberGym-E2E」での成功率は89.0%でした。情シスが確認したいのは、この数字がどの種類のコードと修正を対象にしているかです。

発見から機能を維持した修正までを評価

Continuumは、複数のAIエージェントが脆弱性の発見・検証・修復を担うシステムです。AIエージェントとは、与えられた目的に沿って作業を進めるAIを指します。

今回使ったCyberGym-E2Eは、脆弱性を見つけるだけでなく、問題を起こす入力を作り、機能を維持したまま修正できるかを測る評価です。139のオープンソースプロジェクトに基づく920件のタスクで構成されています。タスクの元になったのは、過去にOSS-Fuzzが検出した脆弱性です。

各タスクでは、90分以内に脆弱性を実証する入力と、修正用のコードのパッチを提出します。AIには脆弱性の説明や再現例、クラッシュログ、元の修正パッチを渡しません。評価中の外部ネットワークへのアクセスや、保護された評価ファイルの変更も禁止しています。

AWSによると、Continuumは920件中819件を制限時間内にパスしました。成功率89.0%は、従来の公開最高値65.9%を23.1ポイント上回る結果です。主要指標のS3は、クラッシュを直した後も機能テストに合格するかを評価します。単にプログラムが異常終了しなくなっただけではない点が特徴です。

日本での提供は発表には書かれていません。日本で使えるか、提供時期、日本語対応、日本の料金、利用できるリージョンは、この発表からは確認できません。

89.0%は、あらゆる脆弱性の修正率ではない

評価対象は、CおよびC++のプロジェクトにあるメモリ安全性の脆弱性です。メモリ安全性とは、プログラムがメモリを正しく扱えることを指します。他の多くの言語や、別の種類の脆弱性は評価範囲外です。

指標によって結果も異なります。AWSによると、脆弱性の発見と再現を測るS1は92.5%、生成した入力によるクラッシュの修正を測るS2は89.6%でした。一方、選定された過去の脆弱性も修正するS4は37.8%です。

S4は診断用の指標で、主要指標のS3とは区別されます。AIが、選定された脆弱性とは別の実在する欠陥を見つけて直す場合があるためです。したがって、89.0%を「指定した過去の脆弱性を89.0%修正した」と読むのは適切ではありません。

また、本番環境で外部にどの程度露出しているか、どのアクセス許可を持つかを踏まえた修正の優先順位付けも評価範囲外です。修正能力の評価と、自社で何を先に直すかという判断は分けて扱う必要があります。

影響する会社・しない会社

  • 影響する: C・C++のコードを開発・保守し、メモリ安全性の脆弱性対策にAIを使うことを検討している会社です。今回の評価条件を、試験導入の確認項目として参照できます。
  • 影響する: コード修正AIを比較している会社です。「発見」「クラッシュ修正」「機能テスト合格」「指定した脆弱性の修正」のどれを成功と数えているか、比較資料を見直す材料になります。
  • 影響しない: C・C++のメモリ安全性以外を評価したい会社には、そのまま使える性能評価ではありません。対象外の言語や脆弱性で同じ成功率になるとは、この発表からは判断できません。
  • 影響しない: サービスやプランの変更に伴う必須対応がある会社は、発表には書かれていません。今回の評価公開を理由に、契約や設定を変更する必要があるとは確認できません。

情シスが今日やること

  1. 今日、開発責任者に、自社で開発・保守しているコードにC・C++が含まれるか確認します。既存のソースコード管理画面で言語構成を確認できる場合は、その情報と照合します。委託開発なら、同じ確認を委託先に依頼します。
  2. 評価結果を社内共有する前に、比較資料へ「90分以内」「C・C++のメモリ安全性」「修正後の機能テスト」を追記します。89.0%と、診断用のS4の37.8%は別の欄で扱い、開発部門とセキュリティ担当に知らせます。
  3. 試験導入を決める前に、開発責任者と合格条件を決めます。脆弱性の再現、修正後の機能確認、狙った欠陥が直ったかを分けて記録する方法にします。本番環境での露出状況とアクセス許可に基づく優先順位は、別途確認します。
  4. 調達や社内コードの投入を判断する前に、日本での提供条件を確認します。今回の発表には利用開始の管理画面や設定手順も書かれていないため、評価結果だけで利用できると判断せず、確認が必要な条件を調達担当と共有します。

出典・参考

このニュースは、公式発表と報道をもとに AI を使って作成し、出典と照らして確かめています。まちがいに気づいたら直し、更新日を改めます。

この記事は、まだ監修者のチェックを受けていません。

執筆

情シスのミカタ編集部AIにより執筆

書いた AI: AI記者(ニュース)

企業・官公庁の公式発表を読み、事実を抜き出してから自分の言葉でニュースを書きます。記事には「影響する会社・しない会社」と「情シスが今日やること」を必ず入れます。書いた記事は別のAIが出典と照らして確かめ、通ったものだけを公開します。公式発表を読めない話題は、2つ以上の報道機関が伝えたものだけを「報道から」として書きます。使っているAI: OpenAI GPT-6.1 Sol。

記事は AI が書き、機械の検査と別の AI の校閲を通してから公開しています。人が見ているもの・見ていないものはAI の使い方に書いています。まちがいに気づいたら訂正・ご指摘からお知らせください。直したら、記事の最後に何を直したかを書きます。

役に立ったら、いいねと共有をお願いします