Narayana AI Academy & Studio · NAI-07

Метрика до и после: как честно считать пользу AI, а не эффект демонстрации

На демонстрации AI готовит ответ за сорок секунд. Раньше сотрудник тратил двадцать минут. На слайде появляется «ускорение в 30 раз», и пилот объявляют успешным. За кадром остаются подготовка данных, исправление выдуманного факта, проверка руководителем, настройка интеграции и два случая, которые не показали. Через месяц очередь снова растёт — но красивое число уже живёт в презентации.

Иллюстрация к статье «Метрика до и после: как честно считать пользу AI, а не эффект демонстрации»
Иллюстрация к статье «Метрика до и после: как честно считать пользу AI, а не эффект демонстрации»

Короткий ответ

На демонстрации AI готовит ответ за сорок секунд. Раньше сотрудник тратил двадцать минут.

На демонстрации AI готовит ответ за сорок секунд. Раньше сотрудник тратил двадцать минут. На слайде появляется «ускорение в 30 раз», и пилот объявляют успешным. За кадром остаются подготовка данных, исправление выдуманного факта, проверка руководителем, настройка интеграции и два случая, которые не показали. Через месяц очередь снова растёт — но красивое число уже живёт в презентации.

Польза AI — не разница между старым средним и лучшим новым примером. Это изменение в сопоставимом процессе относительно правдоподобной альтернативы, вместе с качеством, вредом, человеческим временем, полными затратами и неопределённостью. Иногда честный вывод пилота звучит не «окупается», а «данных пока недостаточно».

По состоянию на 28 августа 2026 года подробный блок публичной карты Narayana отмечает Narayana AI Academy & Studio как направление «В развитии», тогда как обзорная матрица той же карты использует ярлык «В разработке». В серии сохраняется согласованный подробный статус; коллизию формулировок нужно устранить до публикации. Страница упоминает baseline, метрику «до / после», пилот и масштабирование после доказанного эффекта. Это описание будущего предложения, не доказательство проведённого обучения, работающей Studio, внедрённого пилота, действующих метрик, автоматизации, ROI, партнёрства или результата. Публичный DNS находится под registrar hold; содержание полностью проверено через верифицированный production-origin `201.24.116.180`, canonical сохраняется.

Ниже — независимая модель оценки одного ограниченного процесса. Она не описывает действующую практику Narayana, не является финансовым расчётом и не обещает прибыль, экономию, точность или причинный эффект.

До и после — ещё не причина и следствие

Пусть команда измерила среднее время ответа в августе, подключила AI в сентябре и сравнила результаты. Разница может быть связана с инструментом. Но одновременно могли измениться спрос, состав обращений, опыт сотрудников, правила, рекламная кампания, сезон, мотивация и качество исходных данных.

Baseline — зафиксированное состояние процесса до вмешательства: единица работы, поток случаев, роли, качество, время, ошибки, стоимость и условия. Follow-up — измерение после изменения. Counterfactual — правдоподобный ответ на вопрос: что произошло бы с теми же задачами в то же время без AI? Его нельзя наблюдать напрямую; дизайн сравнения лишь приближает его.

Holland в классической статье о статистике и причинном выводе формализовал проблему потенциальных результатов: для одной и той же единицы нельзя одновременно наблюдать исход с вмешательством и без него. Поэтому одно before/after наблюдение описывает изменение, но редко доказывает причину.

Разумный пилот не обязан быть академическим исследованием. Он обязан соразмерить силу заявления с дизайном. «На этой выборке после включения время было ниже» — описание. «AI снизил время» — причинное утверждение, которому нужен более сильный контроль альтернативных объяснений.

Сначала определите единицу сравнения

Слова «сотрудник стал быстрее» ничего не измеряют, пока не названа единица работы. Это может быть одно обращение определённого типа, карточка бронирования, сверка счёта, подготовка публикации или обработка заявки.

Для каждой единицы фиксируют:

  • критерии включения и исключения;
  • сложность, канал, язык, объём и срочность;
  • обязательный результат и допустимый отказ;
  • момент начала и окончания работы;
  • ручные действия до и после AI;
  • reviewer, исправление, повторная работа и эскалация;
  • последствия ошибки для человека и процесса.

Если baseline состоит из простых писем, а AI дают сложные претензии, сравнение несправедливо. Если в демонстрацию попали только случаи, где модель уверена, нужно показать coverage: какую долю реального потока система вообще берёт и что происходит с остальными.

Сильнее среднего «до» и «после»: парное сравнение

Для небольшого пилота полезен paired design: одни и те же или заранее сопоставленные случаи проходят обычный и AI-assisted маршрут. Порядок случайно чередуют, исходы оценивают по одной рубрике, а независимый reviewer по возможности не знает, какой режим использован. Это уменьшает влияние разной сложности, но не устраняет обучение: сотрудник может запомнить первый случай.

Другой вариант — параллельные группы или ступенчатое включение. Часть сопоставимого потока временно остаётся в обычном процессе, часть получает AI; затем режимы меняются по заранее записанному плану. Случайное назначение, когда оно допустимо, усиливает причинную интерпретацию. Если рандомизация невозможна, ограничения нужно назвать, а не спрятать за словом «эксперимент».

Vickers и Altman в разборе baseline и follow-up показывают, что способ анализа исходного уровня и последующего результата влияет на точность оценки. Их статья относится к контролируемым медицинским испытаниям; для бизнес-пилота важен общий урок: заранее выбрать метод сравнения, а не тот, который после данных даёт самый красивый результат.

Пять этажей метрик

Одна метрика скорости легко оптимизируется ценой всего остального. Минимальная карта должна связывать пять уровней.

УровеньЧто измерятьТипичная ошибка
Процессcycle time, ожидание, касания, очередь, coverageсчитать только время генерации
Выходкорректность, полнота, формат, grounding, reworkоценивать по впечатлению автора demo
Исходрешённый запрос, принятие клиентом, повторное обращениеприписывать AI то, что изменил весь процесс
Вред и guardrailsкритические ошибки, утечки, жалобы, override, пропускиусреднять редкий серьёзный провал
Ресурсылицензии, интеграция, данные, проверка, обучение, поддержкасчитать только цену подписки

Метрики процесса

Измеряйте календарное и активное время отдельно. Генерация может занять минуту, а ожидание reviewer — сутки. Число касаний показывает передачу между ролями; queue length — устойчивость потока; coverage — долю случаев, для которых AI-маршрут вообще допустим.

Метрики выхода

Фиксируйте общую рубрику до пилота. Отдельно считайте критические требования и косметические правки. Средний балл не должен скрывать неверную цену, незаконное раскрытие, опасную инструкцию или пропущенное обязательство.

Метрики исхода

Выход может быть грамотным, но не решить задачу. Нужны показатели реального следующего шага: доля обращений, закрытых без повторного контакта; количество подтверждённых исправлений; время до принятого решения; удовлетворённость с известным response rate. Рост кликов сам по себе не доказывает пользу человеку или бизнесу.

Метрики вреда

До запуска задают guardrails: ноль отправок без полномочия, ноль секретов в prompt, предел критических ошибок, обязательный human review для заданных классов, максимальная задержка override. Guardrail — не ещё один средний KPI. Его нарушение может остановить пилот независимо от скорости.

Метрики ресурсов

Полная стоимость включает discovery, подготовку и очистку данных, интеграцию, лицензии, инфраструктуру, безопасность, юридическую проверку, обучение, поддержку, мониторинг, инциденты, human review, rework и стоимость переключения. Время владельца процесса и сотрудников оценивают по согласованной ставке или хотя бы показывают отдельно в часах.

CHEERS 2022 создан для прозрачного отчёта об экономических оценках в здравоохранении, а не для AI-бизнес-кейса. Как профессиональный референс он полезен вопросами: чья перспектива выбрана, какие альтернативы сравниваются, какие ресурсы и последствия включены, какой горизонт и какие допущения. Называть такой расчёт «ROI» можно только после определения формулы, периода, денежных потоков и границ; статья этого не делает.

Не прячьте разброс за одним числом

Среднее время 8 минут мало говорит без распределения. Покажите медиану, межквартильный диапазон, хвост, долю критических случаев и число наблюдений. Для разницы или отношения полезен доверительный интервал либо иной честно выбранный интервал неопределённости.

Gardner и Altman в статье о confidence intervals предлагали оценивать размер различия и диапазон совместимых с данными значений, а не делить результат только на «значимый» и «незначимый». Доверительный интервал не означает «95% вероятность, что истинный эффект внутри» в частотной интерпретации и не исправляет плохой дизайн. Он показывает неопределённость оценки при допущениях метода.

Маленькая выборка может дать большой эффект с широким интервалом. Это не провал отчёта — это честный сигнал `hold` или продолжить сбор. Отсутствие статистической определённости не доказывает отсутствия полезного эффекта, а красивый point estimate не гарантирует его повторение.

Шесть ловушек демонстрационного эффекта

1. Selection bias

В пилот берут мотивированных сотрудников, удобные документы и понятные запросы. Результат относится к отобранной группе, а не автоматически ко всему потоку. Покажите funnel: сколько случаев было, сколько исключено, почему и с каким исходом.

2. Novelty и Hawthorne effects

Люди внимательнее работают, когда за ними наблюдают и дают новый инструмент. Систематический обзор McCambridge, Witton и Elbourne о Hawthorne effect нашёл неоднородные эффекты участия в исследовании и недостаточно оснований для одного универсального размера. Поэтому первые дни не следует выдавать за устойчивый режим; нужны более длинное наблюдение и повтор после снижения новизны.

3. Regression to the mean

Пилот часто запускают после особенно плохой недели. Даже без изменения экстремальный показатель может приблизиться к обычному уровню. Barnett, van der Pols и Dobson объясняют regression to the mean и способы учитывать её дизайном и анализом. Практически это аргумент за несколько baseline-периодов и сопоставимую контрольную линию.

4. Seasonality и внешний тренд

Сентябрь нельзя механически сравнивать с тихим августом. День недели, праздники, загрузка, акции, состав клиентов и кадровые изменения влияют на результат. Bernal, Cummins и Gasparrini в tutorial по interrupted time series рассматривают autocorrelation, seasonality и time-varying confounders. Это не призыв применять сложную модель к десяти случаям, а напоминание собирать временной контекст.

5. Learning curve и неравное принятие

Adoption — не бинарная кнопка. Кто-то использует AI во всех допустимых случаях, кто-то — раз в неделю, кто-то тратит время на обход ошибок. Считайте exposure, активное использование, обучение, опыт и результаты по группам, не только общий итог.

Исследование Brynjolfsson, Li и Raymond Generative AI at Work анализировало ступенчатое внедрение у 5 172 операторов поддержки и обнаружило средний рост обработанных вопросов в час с существенной неоднородностью: менее опытные выигрывали больше, у наиболее опытных эффект был мал и местами качество снижалось. Это результат одного конкретного сервиса и процесса, а не коэффициент для Narayana.

6. Перенос лабораторного эффекта

Noy и Zhang в пререгистрированном эксперименте с 453 специалистами нашли сокращение времени и рост экспертной оценки качества в ограниченных письменных задачах. Это сильнее демонстрации, но не доказывает эффект в CRM, гостинице или долгом workflow. Метаанализ Vaccaro, Almaatouq и Malone 106 экспериментов показал, что человек с AI в среднем не превосходил лучшего из них по отдельности, а результаты сильно зависели от задачи и конструкции взаимодействия.

Паспорт измерения до первого прогона

До данных команда записывает:

  1. вопрос решения и допустимую силу вывода;
  2. единицу работы, population, inclusion и exclusion;
  3. baseline-период и источник данных;
  4. альтернативу без AI и способ назначения режимов;
  5. primary metric и её формулу;
  6. quality rubric, harm metrics и guardrails;
  7. полную карту затрат и человеческого времени;
  8. размер выборки либо доступный поток и минимально полезную разницу;
  9. анализ paired cases, пропусков, выбросов и uncertainty;
  10. сегменты: сложность, опыт, канал, adoption и coverage;
  11. stop-условия и владельца остановки;
  12. варианты решения после пилота: `stop`, `rework`, `hold`, ограниченный `scale`.

NIST AI RMF Core предлагает сравнивать ожидаемые выгоды и затраты с подходящими benchmarks, измерять риски и влияние, документировать ограничения и продолжать monitoring. NIST Measure Playbook подчёркивает независимость TEVV, репрезентативность, feedback и измерение harms. NIST AI 600-1 добавляет специфические риски генеративного AI. Это добровольные американские рамки, не российское право и не оценка конкретного проекта.

Initial public draft NIST AI 200-2 TEVV-Athlon от августа 2026 года предлагает строить контекстную assessment из целей, событий, инструментов и измеряемых блоков. Документ открыт для комментариев до октября 2026 года; его нельзя называть окончательным стандартом.

ISO/IEC 25059:2023 даёт модель качества AI-систем, ISO/IEC TS 25058:2024 — руководство по evaluation через quality model, а ISO/IEC 42001:2023 — рамку системы менеджмента AI. Это профессиональные международные референсы, не доказательство соответствия, сертификации или внедрения Narayana.

Stop-правила защищают от влюблённости в пилот

Stop-условия записывают до результата. Примеры: критическое раскрытие данных; неработающий override; превышение предела серьёзных ошибок; рост общей нагрузки после учёта review; отсутствие достаточного coverage; невозможность воспроизвести журнал; затраты выше заранее согласованного потолка.

При остановке не удаляют неудобные строки. Фиксируют версию, событие, воздействие, временные меры и условия повторного теста. `Stop` не означает «AI никогда не нужен». Он означает, что этот use case в этой конфигурации не получил разрешения продолжать.

Решение после пилота — четыре варианта, а не презентация победы

  • Stop: критический риск, недопустимый вред или отсутствие правовой/операционной основы.
  • Rework: гипотеза остаётся разумной, но нужны другой процесс, данные, интерфейс, роли или guardrails.
  • Hold: направление не опровергнуто, но выборка, период или качество данных не позволяют решить.
  • Ограниченный scale: критерии выполнены в заявленной области, мониторинг и владелец остаются, расширение требует новой оценки.

Deaton и Cartwright в статье Understanding and misunderstanding randomized controlled trials напоминают: даже рандомизация не отвечает автоматически на все вопросы переноса, механизмов и внешней применимости. Поэтому сильный пилот всё равно доказывает не «AI полезен вообще», а ограниченное утверждение о конкретной системе, группе, процессе и времени.

Как это относится к Narayana AI Academy & Studio

Для направления «В развитии» метрика до и после может быть принципом будущего дизайна: один bounded use case, baseline до изменения, сопоставимая альтернатива, человеческая проверка, качество, harm guardrails, полные затраты и заранее записанное решение. Но публичная страница не показывает фактический dataset, период, контроль, метрики, выборку, затраты, interval estimates, результаты или независимую проверку Studio.

Честный следующий шаг — создать пустой measurement passport и испытать его на синтетическом процессе. Цель — проверить, умеет ли команда одинаково считать ручной и AI-assisted маршрут, включая review и rework. До отдельного подтверждения оператора, данных, права, людей, поставщика и фактического пилота нельзя публиковать цифры эффекта.

Метрика нужна не для того, чтобы оправдать купленный инструмент. Она нужна, чтобы принять обратимое решение под неопределённостью. Если контроль слабый, выборка удобная, затраты неполные, вред усреднён, а интервал не показан, «до / после» остаётся эффектом демонстрации.

Фактологическая основа

Источники и дальнейшее чтение

  1. Narayana AI Academy & Studio
  2. публичной карты Narayana
  3. NIST AI RMF Core
  4. NIST Measure Playbook
  5. NIST AI 600-1
  6. NIST AI 200-2 TEVV-Athlon
  7. ISO/IEC 25059:2023
  8. ISO/IEC TS 25058:2024
  9. ISO/IEC 42001:2023
  10. статистике и причинном выводе
  11. baseline и follow-up
  12. confidence intervals
  13. regression to the mean
  14. Hawthorne effect
  15. interrupted time series
  16. эксперименте с 453 специалистами
  17. Generative AI at Work
  18. 106 экспериментов
  19. CHEERS 2022
  20. Understanding and misunderstanding randomized controlled trials

Священный текст используется как философская рамка, а не как замена научным, юридическим или медицинским данным.