Urgent.News

What's breaking now, across thousands of outlets.

More in AI

Agent Evaluation Metric for multi-turn conversations

Multi-turn agents fail in ways single-turn evaluation misses: one early mistake corrupts every later turn. This post introduces the Agent Evaluation Metric (AEM), a decomposable, turn-level way to…

  • Agent Evaluation Metric (AEM) assesses multi-turn agent performance
  • AEM breaks down agent quality into named, measurable sub-metrics
  • Correctness sub-metrics: Truthfulness and Completeness evaluated turn by turn

More from Thursday 10 September →