Harness(ハーネス)、LLMスキャナーは高精度だがリコール率が低いと警告

Harness(ハーネス)、LLMスキャナーは高精度だがリコール率が低いと警告

Harness(ハーネス)の2026年第3四半期リリースの新しいベンチマークは、精度、再現率、速度、コスト、一貫性の観点から、LLMベースの脆弱性スキャナーと決定論的なAI SASTエンジンを比較することを目的としている。この分析は、人間が関与しない無人スキャンに焦点を当てており、GPT-5.5、Claude Opus 4.8、およびHarness AI SASTを、OWASP WebGoat、OWASP Juice Shop、OWASP Benchmark for Javaという3つの有名な脆弱性テストアプリケーションでテストした。

ベンチマークによると、LLMスキャナーはこれらのテストアプリケーションで非常に高い精度を達成したが、再現率に苦戦したという。GPT-5.5はWebGoatとBenchmark for Javaで100%の精度、Juice Shopで86.4%の精度を達成したとされているが、Opus 4.8は多くの場合、それに僅差で続いた。これらの精度数値にもかかわらず、再現率は不均一であると説明されている。GPT-5.5はWebGoatで26.5%の再現率(62個の真陽性/ 172個の偽陰性)を達成し、Opus 4.8は16.2% (38 TP / 196 FN)を達成した。Juice Shopでは、両モデルとも再現率が25%未満だった。Benchmark for Javaでは、GPT-5.5は100%の再現率を達成したと報告されているが、Opus 4.8はわずか1.1% (16 TP / 1,399 FN)だった。

このベンチマークでは、深刻度の不一致が明らかになった。WebGoatでは、GPT-5.5が重大な脆弱性の38.5%を検出したのに対し、Opusは33.3%だった。Juice Shopでは、GPT-5.5は12.5%に低下したが、Opusは37.5%に上昇した。Benchmark for Javaでは、GPT-5.5は126件の重大な脆弱性全てを検出したが、Opusは1件も検出しなかった。この分析では、精度と再現率の差の一部は、十分に文書化されたテストアプリにおけるなじみやすさや情報漏洩、およびLLMベースのパイプラインを保守的で信頼性の高いレポートに偏らせる計測方法の選択に起因するとしている。

繰り返し実行した場合のばらつきも強調された。Opus 4.8を同一コードで複数回実行したところ、異なる結果が得られた。WebGoatでは、3回の実行でリコール率が16.2%から19.7%、35.5%へと上昇した。Juice Shopでは、16.0%から30.0%まで上昇した後、18.8%まで低下した。Benchmark for Javaでは、実行結果が1ポイント以内の差にとどまった。ベンチマークでは、Opus 4.8が3つのスキャン全てで重大な脆弱性を発見できなかったことが指摘された。これらの変動は、LLMベースのスキャンの確率的な挙動と、その結果として通常のパイプライン使用における予測不可能性を示す証拠として報告された。

速度とコストの差は歴然としていると報告されている。Harness AI SASTはWebGoatを87秒で完了したと報告されている一方、最速のLLMアプローチは30分以上かかり、最遅は1時間近くかかった。GPT-5.5はBenchmark for Javaで最遅と報告されており、WebGoatとJuice Shopでは43~53分だったのに対し、約3時間かかった。コスト追跡はスキャン時間に密接に関連しているとされ、GPT-5.5のコストはWebGoatで27.20ドル、Juice Shopで21.79ドル、Benchmark for Javaで133.58ドルと記載されている。Opus 4.8のコストはそれぞれ29.54ドル、60.66ドル、47.17ドルと記載されている。比較では、Harness AI SASTはスキャン1回当たりの定額償却コストが3.40ドルと提示された。この報告書は、これらのテストにおいて、LLMスキャナーはHarness AI SASTに比べて全体的に1.6~37倍時間がかかり、コストは6~39倍高かったと主張している。

AI推論レイヤーで強化された決定論的スキャナーは、結果を予測可能にしながら精度ギャップの大部分を解消すると報告されている。WebGoatでは、Harness AI SASTの信頼度フィルターを調整することで、精度と再現率の調整可能なトレードオフが示された。「全ての結果」では精度72.9%、再現率54.8%、「ベースライン( AI推論なし)」では精度83.0%、再現率46.5%、「文脈的に安全なものを除外」では精度83.5%、再現率44.0%、「リスクが確認されたのみ」では精度85.1%、再現率40.3%だった。ベンチマークでは、これらの結果を、再現率の低下やモデルが以前にアプリケーションを見たことがある必要性なしに、LLMに匹敵する精度を達成する方法として位置付けている。

パイプライン使用時のコストとレイテンシーに対処するため、GPT-5.5(258Kトークンコンテキスト)を使って、dvpwa、govwa、vulpyの3つのリポジトリーで増分スキャン方式がテストされた。報告によると、2つのケースで大幅なコスト削減が実現した。dvpwaのフルスキャンは26.20ドルで50分かかったが、増分スキャンは4.51ドルで16分で、フルスキャンの16個に対して20個の実際の問題が見つかりました。govwaでは、フルスキャンで見つかった全ての問題が保持され、コストが83%削減され、スキャンが72%高速化された。vulpyは異なる挙動を示しました。増分スキャンは58%安価だったが、フルスキャンで検出された13のルールカテゴリーのうち9個が見つかりませんでした。この不足は、3つのコミットにわたって44,000行以上が追加された非常に大きなコミット範囲に起因すると考えられる。

方法論に関する注記には、ハーネス関連のばらつきを減らすためにモデル間で同じCodex Securityセキュリティープロンプトを使うこと、Javaベンチマークの期待結果ファイルから導出された正解データとWebGoatおよびJuice Shopの反復的な強化、そしてスキャナーの検出結果を正解データにマッピングするLLM支援マッチングパイプラインが含まれていると報告されている。ベンチマークでは、その範囲が無人スキャンに焦点を当てていることが強調されており、人間のトリアージ、ターゲットを絞った脅威ハンティング、およびセキュリティーエンジニアが通常行うような反復的な検証は明示的に除外されている。

Harnessは、LLMのみのスキャナーは侵入テストや重要なアプリケーションの定期的な詳細スキャンに限定し、コードパイプラインでの継続的なスキャンでは、従来の決定論的スキャナーによる検出結果の検証と推論にLLMを使うことを推奨した。レポートでは、予測不可能性、レイテンシー、コストといった点から、LLMのみのスキャンは今日の日常的なプルリクエストやコミットスキャンには適さないと警告し、検出と予測可能性、コスト管理のバランスを取るために、段階的またはハイブリッドなアプローチを提案している。

出典:Harness

この製品の詳細については、Harness製品ページをご覧ください。

You've successfully subscribed to DXable News
Great! Next, complete checkout to get full access to all premium content.
Welcome back! You've successfully signed in.
Unable to sign you in. Please try again.
Success! Your account is fully activated, you now have access to all content.
Error! Stripe checkout failed.
Success! Your billing info is updated.
Billing info update failed.
Dark Light