AWSは2026年10月8日、コードの脆弱性を探して修正するAI「AWS Continuum for code vulnerabilities」の評価結果を公開しました。AWSによると、公開ベンチマーク「CyberGym-E2E」での成功率は89.0%でした。情シスが確認したいのは、この数字がどの種類のコードと修正を対象にしているかです。
発見から機能を維持した修正までを評価
Continuumは、複数のAIエージェントが脆弱性の発見・検証・修復を担うシステムです。AIエージェントとは、与えられた目的に沿って作業を進めるAIを指します。
今回使ったCyberGym-E2Eは、脆弱性を見つけるだけでなく、問題を起こす入力を作り、機能を維持したまま修正できるかを測る評価です。139のオープンソースプロジェクトに基づく920件のタスクで構成されています。タスクの元になったのは、過去にOSS-Fuzzが検出した脆弱性です。
各タスクでは、90分以内に脆弱性を実証する入力と、修正用のコードのパッチを提出します。AIには脆弱性の説明や再現例、クラッシュログ、元の修正パッチを渡しません。評価中の外部ネットワークへのアクセスや、保護された評価ファイルの変更も禁止しています。
AWSによると、Continuumは920件中819件を制限時間内にパスしました。成功率89.0%は、従来の公開最高値65.9%を23.1ポイント上回る結果です。主要指標のS3は、クラッシュを直した後も機能テストに合格するかを評価します。単にプログラムが異常終了しなくなっただけではない点が特徴です。
日本での提供は発表には書かれていません。日本で使えるか、提供時期、日本語対応、日本の料金、利用できるリージョンは、この発表からは確認できません。
89.0%は、あらゆる脆弱性の修正率ではない
評価対象は、CおよびC++のプロジェクトにあるメモリ安全性の脆弱性です。メモリ安全性とは、プログラムがメモリを正しく扱えることを指します。他の多くの言語や、別の種類の脆弱性は評価範囲外です。
指標によって結果も異なります。AWSによると、脆弱性の発見と再現を測るS1は92.5%、生成した入力によるクラッシュの修正を測るS2は89.6%でした。一方、選定された過去の脆弱性も修正するS4は37.8%です。
S4は診断用の指標で、主要指標のS3とは区別されます。AIが、選定された脆弱性とは別の実在する欠陥を見つけて直す場合があるためです。したがって、89.0%を「指定した過去の脆弱性を89.0%修正した」と読むのは適切ではありません。
また、本番環境で外部にどの程度露出しているか、どのアクセス許可を持つかを踏まえた修正の優先順位付けも評価範囲外です。修正能力の評価と、自社で何を先に直すかという判断は分けて扱う必要があります。
影響する会社・しない会社
- 影響する: C・C++のコードを開発・保守し、メモリ安全性の脆弱性対策にAIを使うことを検討している会社です。今回の評価条件を、試験導入の確認項目として参照できます。
- 影響する: コード修正AIを比較している会社です。「発見」「クラッシュ修正」「機能テスト合格」「指定した脆弱性の修正」のどれを成功と数えているか、比較資料を見直す材料になります。
- 影響しない: C・C++のメモリ安全性以外を評価したい会社には、そのまま使える性能評価ではありません。対象外の言語や脆弱性で同じ成功率になるとは、この発表からは判断できません。
- 影響しない: サービスやプランの変更に伴う必須対応がある会社は、発表には書かれていません。今回の評価公開を理由に、契約や設定を変更する必要があるとは確認できません。
情シスが今日やること
- 今日、開発責任者に、自社で開発・保守しているコードにC・C++が含まれるか確認します。既存のソースコード管理画面で言語構成を確認できる場合は、その情報と照合します。委託開発なら、同じ確認を委託先に依頼します。
- 評価結果を社内共有する前に、比較資料へ「90分以内」「C・C++のメモリ安全性」「修正後の機能テスト」を追記します。89.0%と、診断用のS4の37.8%は別の欄で扱い、開発部門とセキュリティ担当に知らせます。
- 試験導入を決める前に、開発責任者と合格条件を決めます。脆弱性の再現、修正後の機能確認、狙った欠陥が直ったかを分けて記録する方法にします。本番環境での露出状況とアクセス許可に基づく優先順位は、別途確認します。
- 調達や社内コードの投入を判断する前に、日本での提供条件を確認します。今回の発表には利用開始の管理画面や設定手順も書かれていないため、評価結果だけで利用できると判断せず、確認が必要な条件を調達担当と共有します。