Короткий ответ
Рецепт против «игры в метрики» — не отказ от измерений, а их правильная конструкция. Среднее время обработки, CSAT и внутренняя оценка качества по отдельности вознаграждают самый дешёвый путь: быстрые ответы, переносящие работу на потом, опросы только для простых кейсов и завышенную аттестацию. Сервис растёт, когда каждый показатель эффективности связывают с контриетрикой результата, разрешение измеряют по повторным обращениям, оценщиков калибруют, а противоречия обрабатывают как инциденты.
Главные выводы
- Любой показатель, превращённый в цель, перестаёт быть честным сигналом — это закон Гудхарта; сотрудники оптимизируют число, а не качество сервиса, и это рациональная адаптация, а не злой умысел.
- Среднее время обработки, CSAT и баллы контроля качества — самые частые анти-паттерны, если их продвигают в одиночку: появляются «быстрые касания», преждевременное закрытие, смещение выборки опросов и инфляция оценок.
- Сигнал проблемы — не падение цифры, а противоречие: зелёная метрика растёт, а повторы обращений, эскалации и возвраты ухудшаются в течение двух недель подряд.
- Прежде чем тиражировать «улучшившийся» KPI, проведите перевод «метрика → поведение → влияние на клиента» и назовите самый вероятный класс: игра, дрейф определения или реальный результат с запаздыванием.
- Надёжное разрешение измеряют по наблюдаемым повторным обращениям в окне 24–72 часов, а не по самоотчёту агента, а оценки качества защищают калибровкой нескольких оценщиков.
- Контриетрика без владельца и без заранее решённого порога срабатывания — это просто лишний график; решения должны определять, что ставится на паузу при ухудшении результата.
Анти-паттерн: когда показатель становится целью
Экономист Чарльз Гудхарт ещё в 1975 году заметил, что любая статистическая закономерность начинает разрушаться, как только на неё давят в целях контроля; антрополог Мэрилин Стратерн позже свела идею к формуле «когда мера становится целью, она перестаёт быть хорошей мерой». Это не абстракция про экономику, а ежедневная реальность фронт-лайна: как только руководитель объявляет «мы сокращаем среднее время разговора», поведение агентов начинает меняться ещё до того, как изменится сервис.
Важно не читать это как обвинение персонала. Когда на кону бонус, оценка или даже сохранение рабочего места, люди оптимизируют то, что вознаграждается, — так же естественно, как вода находит трещину. Поэтому первое правило метрического дизайна: проектируйте систему так, чтобы правильное обслуживание было дешёвым, а «накрутка» цифр — дорогой. Если самый простой путь к цели вредит клиенту, значит, цель сформулирована неверно, а не сотрудник «плохой».
- Измерение меняет поведение ещё до того, как меняется результат — учитывайте это при каждом новом показателе.
- Игра в метрики — обычно рациональная реакция на стимул, поэтому чинить нужно стимул, а не людей.
- Самый дешёвый способ достичь числа почти всегда существует — и он почти всегда вреден для клиента.
Типовые анти-паттерны сервисных команд
Среднее время обработки (AHT) как главная цель — классика. Под давлением скорости агенты начинают делать короткие «касания»: макрос-подтверждение вместо диагностики, быстрый ответ, который двигает тикет на миллиметр. AHT падает, а повторные обращения в течение недели и эскалации растут: общий труд клиента и команды увеличивается, хотя на слайде — победа.
CSAT искажается выборкой. Если опрос отправляют только по закрытым «решённым» тикетам или меняют тайминг и условия запуска, средний балл может расти при падающей доле ответов и более злых комментариях в свободной форме. Это не «клиенты сложные», а типичный дрейф определения.
Внутренние оценки качества страдают инфляцией: проверяющие берут простые тикеты, ставят баллы снисходительно из-за жёсткой шкалы «да/нет», а агенты учатся «писать под рубрику» — соблюдать тон и формат, но не решать задачу клиента. Итог — «великолепные» 90+ баллов, которые не коррелируют с реальным опытом. Наконец, в удалённой работе появляются метрики «присутствия» — часы за экраном и нажатия клавиш, которые сотрудники обходят перформативной активностью.
- AHT в одиночку → быстрые касания, преждевременное закрытие, рост повторов и эскалаций.
- CSAT без гигиены выборки → рост балла при падающем отклике и злых вербатимах.
- Баллы качества без калибровки → инфляция, проверка «лёгких» тикетов и игра «под рубрику».
- Метрики активности (часы, нажатия) → перформативная работа вместо результата.
Как распознать «метрический мираж» за 48 часов
Ключевой сигнал — не плохой тренд, а противоречие: первичный показатель улучшается, а два результативных индикатора ухудшаются две недели подряд. Соберите «снимок противоречия»: первичный KPI, один соседний операционный показатель и несколько нижних индикаторов — уровень эскалаций, повторы в течение 7 дней, возвраты, жалобы. Добавьте несколько артефактов: эскалированных веток, один отзыв контроля качества и один комментарий клиента.
Затем классифицируйте причину, не обвиняя людей. Три класса выглядят одинаково на дашборде: игра (работа уходит вниз по потоку или за границу метрики), дрейф измерения (изменились определение, выборка или каналы) и реальное улучшение с запаздыванием (результат — чурн и повторные покупки — реагирует неделями). По одному проверочному тесту на каждую гипотезу: выборочно посмотрите «быстро выигранные» тикеты на предмет пустых макросов, сравните одинаковые когорты каналов и типов, а затем дайте ближним исходам 1–2 недели, чтобы показать движение раньше чурна.
Правило: не меняйте цели широко, пока не сможете одной фразой назвать, какая когорта ухудшилась и какое поведение, вероятно, сдвинулось. Если метрика улучшилась, а исход ухудшился — сначала проверьте игру, дрейф и запаздывание по очереди. Это предотвращает и преждевременный откат рабочего изменения, и закрепление вредной привычки «так мы теперь работаем».
Конструкция метрик, которые не провоцируют обход
Правильный ответ — не «меньше метрик», а «связанные метрики». Скорость связывайте с качеством разрешения: не добавляйте просто график повторов, а введите ревью закрытия в точке давления — где тикет закрывают, чтобы защитить AHT или SLA. У каждой контриетрики должен быть владелец и заранее решённый порог: что ставится на паузу, откатывается или пересматривается, когда результат пересекает границу. Иначе контриетрика — просто украшение дашборда.
Разрешение измеряйте по наблюдению, а не по самоотчёту. Надёжный показатель первого контакта (FCR) — это доля обращений, после которых клиент не вернулся с той же проблемой в окне обычно 24–72 часов, с связыванием контактов по каналам. Самоотчёт агента «решил» в условиях давления управляем и не считается доказательством.
Итоговые показатели результата — повторные обращения, ре-открытия, возвраты, отток — менее склонны к игре, но запаздывают. Используйте их как «табло» конечного успеха, а быстрые операционные метрики — как руль для ежедневного управления. Сочетание и есть защита от обхода: гейминг одной метрики становится дорогим, потому что бьёт по другой.
- Парные метрики: скорость ↔ повторное обращение, дефлексия ↔ эскалация, SLA ↔ качество разрешения.
- FCR считайте по повторным контактам в окне 24–72 часа, а не по отметке агента.
- Итоговые метрики (отток, возвраты) — табло успеха; операционные — ежедневный руль.
- У каждой контриетрики — владелец и порог срабатывания, определённые заранее.
Гигиена измерения: калибровка и стабильность
Качество контроля качества — это сам процесс оценки. Проводите регулярные калибровочные сессии, где несколько оценщиков вслепую оценивают одни и те же диалоги и сверяют расхождения; без этого два супервизора за месяцы «разъезжаются» в понимании критериев, и агенты получают разные баллы за одинаковую работу. Разрешите проверяющим цитировать транскрипт — это уменьшает инфляцию из-за оценки «по памяти».
Держите правила отправки опросов зафиксированными на квартал. Если вы меняете условия, тайминг или выборку CSAT, пометьте дашборд и считайте тренд разрывным до перестроения базовой линии. Аналогично фиксируйте определение повторного обращения — «клиент вернулся с той же проблемой в течение 7 дней» — и не меняйте его в угоду отчётности. Изменение определения не меняет сервис, оно меняет только число.
Перед тем как привязать любой показатель к оплате, прогоните перевод «метрика → поведение → влияние на клиента»: что агент под давлением сделает иначе сегодня, и какой вредный ярлык появится первым. Как только метрика привязана к зарплате, люди оптимизируют её так, будто от неё зависит их аренда — потому что так и есть.
Практические решения и компромиссы
Вводите целевую скорость только с определением «решённый исход» для топовых типов обращений и учите на него, а не на «короткий ответ»: скорость должна приходить из лучшей диагностики, макросов и маршрутизации, а не из пропуска шагов. Если нужно быстрое первое касание, требуйте, чтобы первый ответ содержал конкретный следующий шаг, а не пустое подтверждение.
Ужесточайте политику закрытия точечно: требуйте причину закрытия, совпадающую с исходом, и добавьте цикл ревью ре-открытий, ориентированный на обучение, а не на наказание. Дефлексию считайте «сдерживанием с разрешением», а не просто «меньше тикетов»: отслеживайте эскалации из дефлектированных сессий и жалобы в других каналах.
Не масштабируйте локальную победу до компенсационной программы без аудита. Локальное улучшение становится корпоративной историей, потом планом выплат, потом источником странного поведения. Проверяйте стабильные когорты и A/B-тест при широком раскатывании целей и новых структур оплаты, прежде чем называть «победу» реальной.
- Скорость — только с «решённым исходом» и конкретным следующим шагом в первом ответе.
- Закрытие — по причине-исходу, с циклом обучения по ре-открытиям.
- Дефлексия — как сдерживание с разрешением, с контролем эскалаций.
- Не тиражируйте «победу» в оплату без аудита и когортных проверок.
Практический инструмент
Чек-лист аудита метрики перед тем, как она попадёт в зарплату
Быстрый аудит любого первичного KPI, который вы собираетесь продвигать или привязать к оплате. Пройдите пункты по порядку; если хотя бы на одном вы не можете ответить — цель ещё не готова к тиражированию.
- Сформулируйте одной фразой: «Если я агент под давлением и хочу хорошо выглядеть на этой метрике, что я делаю больше, а что меньше?»
- Назовите самый дешёвый путь к числу — включая тот, что вредит клиенту (быстрое закрытие, пустой макрос, скрытие контакта).
- Добавьте контриетрику качества и нижний индикатор результата (повтор в 7 дней, эскалация, возврат).
- Закрепите определение, выборку и условия запуска на квартал без изменений.
- Определите порог срабатывания контриетрики и что ставится на паузу при его пересечении.
- Назначьте владельца контриетрики и триггер ревью (новая политика, маршрутизация, ужесточение цели).
- Проверьте FCR по повторным контактам в окне 24–72 часа, а не по самоотчёту.
- Проведите калибровку оценщиков качества: один диалог, несколько вслепую, сверка расхождений.
- Сравните одинаковые когорты (канал, тип, уровень) до и после изменения, исключая дрейф.
- Укажите ожидаемое запаздывание итогового результата (чурн, повторные покупки) — недели, а не дни.
Частые вопросы
Почему среднее время обработки (AHT) провоцирует обход системы?
Когда AHT становится единственной целью, агенты получают стимул делать короткие «касания» вместо полного решения: макрос-подтверждение, перенос работы на следующий контакт или преждевременное закрытие тикета. AHT падает, но повторные обращения в течение недели, эскалации и общий труд клиента растут. Это типичный анти-паттерн Goodhart: число улучшается, потому что процесс научился его производить, а не потому что клиенту стало лучше. Решение — не отменять скорость, а связывать её с контриетрикой качества разрешения и требовать конкретный следующий шаг в каждом первом ответе.
Как не дать CSAT превратиться в «игру с выборкой»?
CSAT легко «улучшить», меняя, кому и когда отправляется опрос: например, рассылать его только по «решённым» тикетам или после успешного исхода. Сигнал манипуляции — балл растёт при падающей доле ответов и более негативных комментариях в свободной форме. Зафиксируйте правила отправки на квартал, не меняйте условия и выборку без пометки на дашборде, следите за ответной долей и читайте вербатимы, а не только средний балл. При изменении правил считайте тренд разрывным до перестроения базовой линии.
Что такое калибровка оценки качества и почему баллы выше 90% подозрительны?
Баллы качества выше 90% часто отражают не отличный сервис, а изъяны программы: проверку только «лёгких» тикетов, снисходительность оценщиков, жёсткую шкалу «да/нет» и игру агентов «под рубрику» — соблюдение тона и формата без решения задачи клиента. Калибровка — это процесс, где несколько оценщиков вслепую оценивают один и тот же диалог и сверяют расхождения, выравнивая понимание критериев. Без регулярной калибровки оценщики расходятся за месяцы, и агенты получают разные баллы за одинаковую работу.
Почему показатель дефлексии считают «метрикой тщеславия» и как его защитить?
Дефлексия замеряет активность (сколько обращений «отклонено»), а не результат. Если дефлексировать, скрывая контакты с человеком или агрессивно блокируя доступ, спрос не исчезает — он мутирует в эскалации, возвраты и жалобы в соцсетях. Используйте дефлексию как «сдерживание с разрешением»: отслеживайте долю эскалаций из дефлектированных сессий, повторные обращения и отзывы в других каналах. Высокая дефлексия при росте жалоб — классический признак того, что вы оптимизируете не тот показатель.
Как надёжно измерить разрешение с первого контакта (FCR)?
Надёжный FCR — это доля обращений, после которых клиент не возвращается с той же проблемой в течение окна обычно 24–72 часов, с связыванием контактов по каналам. Самоотчёт агента («решил») в условиях давления управляем и ненадёжен. Требуется интеграция данных, чтобы распознать повторный контакт по той же теме. Считайте FCR отдельно по каналам и когортам: голос обычно превосходит асинхронные каналы, а результаты по новичкам и опытным агентам подскажут, где вмешаться.
Чем «контриетрика» отличается от обычного дополнительного графика?
Контриетрика — это показатель, который делает гейминг первичной метрики дорогим, потому что бьёт по результату: скорость связывают с повторными обращениями, дефлексию — с эскалациями, SLA — с качеством разрешения. Но контриетрика без владельца, без заранее решённого порога и без правила «что ставится на паузу при пересечении» — просто украшение дашборда. Определите заранее, что вы откатите или пересмотрите, когда контриетрика ухудшится, и назначьте ответственного с регулярным ревью по триггерам.
Источники и дополнительные материалы
Источники проверены при подготовке страницы. Изменяемые даты, нормы и цены уточняйте у первоисточника.
- When Metrics Improve but Outcomes Get Worse: Diagnosing Goodhart Problems Before They SpreadCalypso
- How Teams Accidentally Optimize the Wrong Metric (and How to Catch It Early)Calypso
- Remote work brought unfair performance metrics – and employees are gaming themMcGill University
- Dangers of the 90%+ QA ScoresMaestroQA
- What Is Goodhart's Law? Balancing Authenticity & MeasurementBMC
- First Contact Resolution (FCR) — GlossaryKustomer
- Gaming the System: What a USPS Smiley Face Reveals About Bad MetricsLean Blog (Mark Graban)