You need continuous improvement for a multi-agent support solution: scalable scoring of free-text answers, periodic synthetic hard cases, and incorporation of user thumbs-down. Which approach best fits?
Select an answer to reveal the explanation.
Short Explanation
B is the continuous-improvement cluster from the blueprint: LLM-as-a-judge, synthetic data generation, semantic optimization loops, and user feedback loops. Together they scale quality work beyond rare manual reviews. A yearly-only review is too slow. C random prod edits are chaos. D uptime pings measure availability, not answer quality. Wire judges to dashboards and promotion gates for a real optimization loop.
Full Explanation
Correct Answer — B
Continuous improvement for multi-agent solutions includes LLM-as-a-judge frameworks, synthetic data generation, semantic optimization loops, and user feedback loops—enabling scalable quality measurement and iterative prompt/model improvements.
Why A is wrong: Annual manual-only review cannot keep pace with drift.
Why C is wrong: Unmeasured random prompt edits risk regressions.
Why D is wrong: Uptime checks do not evaluate answer quality.
Exam tip: LLM-as-judge + feedback + synthetics = continuous optimization story.