IBM Research представила новый подход к измерению и повышению согласованности AI-агентов. Материалы опубликованы в блоге на Hugging Face.
В основе подхода — метрика Pass^k. Она показывает долю задач, в которых агент успешен во всех k запусках. Это отличает её от обычной средней точности Mean@k, которая усредняет результат по запускам.
На бенчмарке AppWorld ReAct-агент на базе GPT-4.1 демонстрирует Mean@5 на уровне 77,4%, тогда как Pass^5 составляет лишь 53,0%. Разрыв согласованности достигает 24,4 процентного пункта.
Для выявления причин нестабильности используется инструмент Consistency Analyzer. Он находит неустойчивые точки решений с помощью контролируемого ресемплинга записанной траектории — без ground truth и без повторного прогона задачи.
На основе полученных данных генерируются consistency guidelines в рамках ALTK-Evolve. Их применение сокращает разрыв согласованности с 24,4 до 12,0 процентного пункта, повышает Pass^5 с 53,0% до 69,0% и Mean@5 с 77,4% до 81,0%.
Код открыт в репозитории ALTK-Evolve, полная методология описана в техническом отчёте на arXiv.
