Optimizely(オプティマイズリー)は、マーケティング分野におけるAIのパフォーマンスを測定するための標準化されたベンチマーク「Mark-Bench」を発表した。これは、マーケティング分野における比較可能な評価ツールの不足を指摘したものだ。同社幹部は、共通の基準がなければ、「マーケティングに優れている」というAIの主張は測定可能な意味を欠き、購入者や実務担当者がモデルを比較したり、マーケティングに特化したAIの実用性を評価したりすることが困難になると主張した。
開発者らは、マーケティングベンチマークの登場を遅らせた3つの主要な課題を挙げた。それは、マーケティングの範囲に関する広く受け入れられた分類体系の欠如、マーケティングの質の本質的な主観性、そしてモデル開発チームによるベンチマークの不正操作のリスクだ。この新しいベンチマークは、これらの課題に直接対処するために作成されたとされている。
Mark-Benchは、17のマーケティング領域にわたるAIを評価し、抽象的な問いではなく、実際のマーケティング業務を反映するように構築されている。Optimizelyによると、このベンチマークは現在、285以上のタスク、15の機能、6,523の評価基準を網羅しており、各シナリオには現実的な概要、ブランドガイドラインやスタイルガイドなどのソースファイル、そして想定される出力形式が提供される。提出物は12~30の評価基準を含むルーブリックに基づいて採点され、特定のモデルの好みに左右される偏りを軽減するため、複数の大規模言語モデル評価ツール(具体的にはClaudeとGemini)によって評価される。
同チームは、ベンチマークの設計において、自動抽出と人間の監視のバランスを重視したと述べている。タスクとルーブリックの開発は、主に4つの情報源に基づいている。オープンソースのMarketing Skillsリポジトリー、約100の自動化タスクを収録したZapierのAutomation Bench、Scott Brinker氏の「State of Martech」調査、そしてOptimizely社内のエージェントライブラリーに加え、パーソナライゼーションとコンバージョン率最適化に関する実務者セッションで補完されたデータである。プロダクトマネージャーのProggo Pratik氏は、Harvey氏の法律ベンチマークを構造的な参考資料として活用し、個別の質問に頼るのではなく、文書ベースのシナリオとタスク概要を適用したと報告されている。初期テストの結果、何度か改良が重ねられた。Optimizely社は、最初のバージョンの評価基準が甘すぎると指摘した。約7,000項目に及ぶ個々の評価基準のうち、モデルは95%以上をクリアしており、真の差別化は、シナリオにおける全ての基準を達成した割合、つまり「全項目合格」率(モデルによって約40%から60%の範囲)でしか確認できなかった。開発チームは、後のバージョンでは、全てのモデルがクリアしていた基準を削除し、より識別力の高い指標に置き換えることで、パフォーマンスの差がより明確になったと述べている。
Mark-Benchは、測定のための2次元ツールとして説明されている。評価者は、周辺システム、プロンプト、ワークフローといった「ハーネス」を一定に保ち、モデルを交換することで、特定のマーケティングタスクにおけるモデル間の強みを判断できる。逆に、モデルを一定に保ち、ハーネスを変化させることで、コンテキスト、プロンプト、オーケストレーションが結果にどの程度影響を与えるかを明らかにできる。Optimizelyの幹部らは、ハーネス設計はモデル選択と同様に結果に大きな影響を与えるため、タスクレベルの粒度が実務的な導入判断に不可欠であると強調した。
長期的な目標として、モデルの自動ルーティングが挙げられている。新モデルはリリース後すぐにMark-Benchで評価され、強みと弱みのプロファイルが生成され、マーケティングタスクは最適なモデルに自動的にルーティングされるようになる。同社幹部は、これによりマーケターが手動でモデルを選択する負担が軽減され、システムが経験的証拠に基づいて選択できるようになると示唆した。
ハーネス設計の運用上の影響を示すために、コスト比較が提示された。同じモデルを3つの構成で直接比較したところ、Optimizelyハーネスを使用した場合、生のモデル(Opus 5X-High)を使用した場合と比較して、タスク当たりのコストが約88%削減され、1タスク当たり4.91ドル対40.52ドルとなり、ハーネス構成の方がわずかに品質スコアも高かった(67%対65%)。Optimizelyはこれを、スマートなルーティングと活用によって、モデルの能力をタスクのニーズに合わせることで、コスト削減と品質向上を両立できるという証拠と解釈した。
コンピューティングとコンテキストの要件の範囲を示すために、具体的なタスク例が提示された。軽量モデルは、指標の説明や要約といったシンプルなチャットボットのクエリーに適しているとされ、中層モデルは、実験アイデアの創出といった単一エージェントのタスクを処理できる。ワークフローエージェントは複数のステップを連結し、異なるサブタスクを異なるモデルにルーティングする。そして、完全に自律的なVirtual Teammatesは、夜間の分析を実行し、内部でルーティングの決定を行うことで異常を検出できる。
製品チームは、自動化された改善への道筋として、機械可読な評価基準の重要性を強調した。製品担当上級副社長のKevin Li氏は、基準が機械が評価できる形式でエンコードされていれば、エージェントはバリエーションを繰り返し、人間が各サイクルごとにプロンプトを書き直すことなく自己改善できると主張したと伝えられている。このアプローチは、マーケターが反復的なプロンプト作成ではなく、より高度な判断力と創造性に集中できるようにする手段として提示された。
透明性と不正防止策がガバナンスの優先事項として挙げられた。Optimizelyは、Mark-Benchを社内開発モデル以外も含め、あらゆるモデルに一貫して適用し、AIのみで生成されたベンチマークが信頼性を失うことを防ぐため、専門家がドメイン、タスク、評価基準をレビューすると述べている。経営陣は、客観性を維持するための取り組みの一環として、結果の公開とオープンな方法論を採用していると説明した。
Mark-Benchは「生きたベンチマーク」と位置付けられており、モデルの改善に伴い評価基準は厳格化され、新しいモデルがリリースされる際には追加され、結果と方法論は検証のために公開される。
出典:Optimizely
この製品の詳細については、Optimizely製品ページをご覧ください。