Evaluatorの有効化

10 minutes

トレースを1つずつ確認する方法はインシデント対応には有効ですが、スケールしません。Evaluator はエージェントのインタラクションを自動的に評価し、問題(ハルシネーション、ツール選択エラー、プロンプトインジェクション)を自動的に検出します。

ペルソナ

Careful Health Providerの AIエンジニア として、アシスタントが根拠のない医療回答を生成した瞬間に把握したいと考えています。SNSでトレンドになってからでは遅いのです。すぐに使えるEvaluatorにより、すべてのリクエストに対する早期警告システムが得られます。

正確な評価。 Splunk Agent Observabilityは、エージェント、出力、RAGの品質を評価するすぐに使えるEvaluatorを提供します。これにより、問題を迅速に発見し、改善を追跡し、エージェントアプリケーションをユーザーにとってより良いものにできます。

Lunaによるスケーラブルな評価

大規模な汎用LLMをジャッジとして使用すると、コストと遅延がすぐに増大するため、ほとんどのチームはトラフィックの一部だけをサンプリングし、残りはスコアリングしません。Splunk Agent Observabilityは、評価に特化して構築・ファインチューニングされた Luna Small Language Modelsを使用し、コストとレイテンシーを大幅に削減して品質をスコアリングします。これにより、本番トラフィックの すべて を評価でき(5〜10%のサンプルではなく)、リアルタイムガードレールに十分な速度で評価を実行できます。

続けて、エージェントストリームでEvaluatorを有効化し、スコアを確認します。