You need a continuous improvement loop for a multi-agent sales assistant. Human review capacity is limited, but you must detect quality regressions in grounded product claims weekly. Which approach aligns with AI-500 continuous improvement practices?
Select an answer to reveal the explanation.
Short Explanation
Answer B. Continuous improvement for multi-agent solutions includes LLM-as-a-judge frameworks, synthetic data generation, semantic optimization loops, and user feedback loops. Automate weekly scoring of grounded claims, track regressions, and feed failures into prompt/tool fixes. Annual-only embedding retrains leave long blind spots. No logging and unmeasured full-fleet prompt pushes are operational anti-patterns.
Full Explanation
Correct answer: B. Optimize prompt and model performance via continuous improvement: LLM-as-a-judge, synthetic scenarios, semantic optimization, and user feedback. For sales grounding, define rubrics (faithfulness to catalog, no inventing SKUs), run judges on gold and synthetic cases, and page owners when scores drop.
A is incomplete: embedding refresh matters for RAG but is not a substitute for ongoing multi-agent quality evaluation.
C is wrong: observability is required to detect and explain regressions.
D is wrong: unmeasured production experiments risk brand and compliance damage; use canaries and gated rollouts with evaluation.
Keep human review for high-severity edge cases while judges cover volume.