Перейти к содержимому
МЕТОДИКА

Как считается Индекс готовности автоматизации

Шесть измерений, веса под российский средний бизнес, честная шкала и формула потерь, которую можно проверить руками. Никакой магии — только арифметика и правила доказательства.

Что мы измеряем

Индекс отвечает на один вопрос: если ваша автоматизация завтра сломается, во что это обойдётся и узнаете ли вы об этом вовремя. Мы не оцениваем, «умная» ли она, — мы оцениваем, надёжная ли. Респондент не инженер, поэтому вопросы бытовые: «никто не узнает до утра» вместо «отсутствует alerting».

Оценка идёт по шести блокам. В каждом — два вопроса, за каждый ответ 0, 2, 3.5 или 5 баллов. Блок нормируется к своему весу, сумма даёт итог от 0 до 100.

Шесть измерений и веса

БлокВесЧто проверяем
1. Надёжность выполнения 20% Что происходит, когда интеграция падает ночью?
Как вы узнаёте, что она упала?
2. Восстановление и повторы 15% После сбоя операция повторяется сама — и не задвоит ли повтор счёт, заказ, письмо?
Есть ли способ откатить неверно выполненную операцию?
3. Права и доступы 15% Может ли автоматизация сделать необратимое действие без человека?
У скрипта отдельная учётка с минимумом прав — или админский доступ?
4. Следы автономной работы 20% Что автоматизация оставляет за собой из секретов — в логах, истории команд, вечных журналах?
Что она оставляет за собой из чужих и персональных данных?
5. Наблюдаемость 15% Ответите за 5 минут, что именно система сделала вчера в 14:30?
Хранятся ли логи и как долго?
6. Зависимость от людей 15% Что сломается, если завтра уйдёт человек, который это настраивал?
Есть ли документация, по которой другой подрядчик подхватит?

Надёжность выполнения и данные/секреты весят по 20% — здесь ломается дороже всего: незамеченный ночной сбой и утёкшие ключи стоят больше, чем неудобный лог. Остальные четыре блока — по 15%.

Как оцениваются ответы

У каждого вопроса четыре варианта, от худшего к лучшему. Им соответствуют баллы:

0 баллов×Проблема есть в полный рост: сбой незаметен, откат невозможен, секреты в коде.
2 баллаЧто-то делается, но вручную и ненадёжно.
3.5 баллаРабочее решение с оговорками — держится, но не идеально.
5 балловСделано правильно: автоматически, безопасно, воспроизводимо.

Итоговая шкала

80–100 A Автоматизация промышленного уровня. Проверьте блок «Следы автономной работы» и живите спокойно.
60–79 B Работает, но держится на одном человеке.
40–59 C Сбой уже случался — вы просто не считали, сколько он стоил.
20–39 D Автоматизация создаёт риск больше, чем экономию.
0–19 F Это не автоматизация, это отложенная авария.

Формулировки жёсткие сознательно. Мягкая оценка не продаёт и не запоминается: «работает, но держится на одном человеке» вы вспомните, а «есть зоны роста» — нет.

Оценка потерь в рублях

Балл показывает уровень риска, но мотивирует цифра. Три дополнительных вопроса переводят балл в деньги по простой и защитимой формуле:

Потери на ручной труд = часы в день × 21 дн × 12 мес × 800 ₽/час Потери от сбоев = число инцидентов × цена инцидента цена инцидента = 40 000 ₽ при балле ниже 40 20 000 ₽ при 40–69 8 000 ₽ при 70 и выше Итого = ручной труд + сбои

Ставка 800 ₽/час — это полная стоимость сотрудника для работодателя, а не «зарплата в час». Цена инцидента и ставка вынесены в редактируемые константы: мы меняем их без правки кода, когда появляются более точные данные по вашей отрасли.

Оценка всегда сверху. Мы намеренно берём верхнюю границу и говорим об этом прямо. Точную цифру считаем на разборе — завышенная непрозрачная сумма убивает доверие ровно там, где мы его зарабатываем.

Правило доверия: Unverified и Verified

Рядом с результатом всегда стоит отметка Unverified — это самооценка по вашим ответам. Мы не прячем это за красивым числом. Verified-оценку мы даём отдельно: приходим и проверяем по первичным источникам — журналам действий, правам доступа, хранилищу секретов и коду. Разница между «я думаю, у нас так» и «проверено» — это и есть то, что мы продаём.

Аудируемость — почему без данных считать нечего

Прежде чем считать балл по фактам, надо ответить на предварительный вопрос: а есть ли что считать. Если не видно, что система запрашивала, что ответила и что после этого изменилось — считать нечего. И это не отказ, а первый вывод: вы управляете тем, чего не видите.

Мы проверяем восемь предпосылок. Каждая — это конкретный след, который система либо оставляет, либо нет.

КодПредпосылкаЧто ищем
A1журнал обращений к моделипромпт, ответ, модель, время, инициатор
A2трассировка выполненияцепочка задача → шаги → вызовы → результат
A3пооперационная стоимостьтокены и деньги на конкретное действие
A4версия конфигурациикакой промпт и настройки действовали в момент события
A5идентификация акторачеловек, расписание или другая система
A6срок хранениязаписи старше 30 дней
A7связь действия с бизнес-фактомстатус «сделано» сопоставим с внешним подтверждением
A8доступ аудиторачтение программно, без ручных выгрузок

Предпосылки появляются вразнобой, поэтому мы не считаем их по порядку, а проверяем, какое множество целиком собралось. Отсюда пять уровней аудируемости — и то, что на каждом вообще можно вычислить:

УровеньЧто собраноЧто вычислимо
L0нет доступаничего
L1A8только статусы
L2A8, A1, A5балл ИГА как verified
L3+ A2, A6плюс ER и DV
L4все восемьплюс PVG, полная проверка

Метрику мы не публикуем без её предпосылки, даже если общий уровень достигнут. Нет журнала связи с фактом (A7) — нет PVG, каким бы правдоподобным ни было число. Это принципиально: показать метрику, под которой нет данных, — то же самое, что чинит наш индекс у клиентов.

A7 — единственная дыра, которую не закрывает ни один инструмент. Журналы платформ и нативные сессии агентов пишутся почти у всех и дают L3 из коробки. Но они записывают, что агент делал, а не к чему это привело — потому что инструмент не знает, что для вашего бизнеса ценность.

Инструменты записывают, что агент делал. Никто не записывает, к чему это привело. Мы соединяем два конца.

Шкала подтверждения P0–P5

PVG — разрыв между «система отчиталась» и «результат случился». Чтобы его посчитать, каждую закрытую задачу мы взвешиваем по тому, чем именно подтверждён её результат. Не все «выполнено» равны.

УровеньЧем подтвержденоВес
P0статус поставил сам исполнитель0.0
P1проверка другим агентом0.3
P2выполнен чек-лист приёмки0.5
P3подтвердил человек0.7
P4факт исполнения — артефакт есть, письмо ушло, запись создана0.9
P5факт ценности — заявка пришла, деньги получены, время высвободилось1.0

Почему подтверждение человеком слабее подтверждения фактом (0.7 против 0.9) — то, что читателю кажется странным. Пример из нашей практики, без имён: задача прошла проверку агентом, её подтвердил руководитель — и всё равно оказалась фантомом, потому что никто не выполнил одну проверочную команду. Человек подтверждает отчёт. Факт подтверждает результат.

И P4 не равен единице: исполнение без ценности — тоже фантом, просто убедительный. Страница опубликована, отдаёт 200 — и пустая. Только когда результат превратился в бизнес-факт (P5), задача перестаёт быть обещанием.

Границы: что мы НЕ меряем

Область аудита очерчена тремя правилами. Каждое отсекает то, что похоже на нашу работу, но ей не является.

Тест на автономность. Мысленно уберите из процесса автономную работу. Если метрика потеряла смысл — она наша. Если осталась осмысленной и без агентов — это не про автономность, и мы за это не беремся.

Правило причинности. Уберите агентов — дефект останется? Останется — он вне области. Мы меряем риск, который создаёт автономная работа, а не общий беспорядок в системе, который был до неё и будет после.

Граница с пентестом. Риск от действий самой системы — наш. Риск от действий внешнего атакующего — не наш. Мы не ищем, как злоумышленник взломает ваш периметр; мы смотрим, что натворит ваш собственный агент, действуя штатно.

Находки вне области. Всё, что мы замечаем за границей — уязвимость, юридический риск, кривой процесс, — мы честно называем и передаём, но не оцениваем и не тащим в балл. Аудитор, который говорит «это не моё», вызывает больше доверия, чем тот, кто во всём нашёл работу для себя.

Два способа: аудит и испытание

Индекс один, а измерить его можно двумя путями. Врач может изучить вашу медкарту или отправить на нагрузочный тест — диагноз про одно сердце, способы разные.

АудитИспытание
Что делаемсмотрим следы прошлой работыдаём контрольные задачи
Требуетаудируемость L2 и вышевозможность запустить систему
ДаётPVG по прошломуPVG по свежим прогонам
Стоитчасыдни плюс расход на прогоны
Слабостьмеряет прошлоеискусственные задачи могут не совпасть с реальными

Испытание — это не отдельная строка прайса, а способ выполнить тот же аудит, когда истории ещё нет: система новая или только что переделана. Среда испытания подчиняется четырём правилам:

1Изоляция. Песочница создаётся под прогон и уничтожается после.
2Паритет. Зависимости, доступы и инструменты совпадают с реальной рабочей сессией.
3Чистое состояние. Песочницы никогда не переиспользуются.
4Раздельный хронометраж. Установка, работа и уборка засекаются отдельно.

Почему переиспользованная песочница завышает результат. Она протекает подсказками из прошлых прогонов: агент «уже знает» ответ не потому, что справился, а потому, что окружение сохранило след прошлой попытки. Доля успеха выходит красивее реальности — и мы бы приняли этот шум за сигнал.

Трения — кому это чинить

Доля успеха говорит, как часто агент справляется. Трение — что именно ему помешало в конкретном прогоне. Это отдельная сущность, и записываем её по пяти полям:

ПолеЧто фиксирует
Семействотип препятствия, чтобы повторы складывались в одну проблему
Тяжестьво что обошлось — от небольшого крюка до провала задачи
Преодолениеагент обошёл препятствие или встал
Владелецкто может починить: продукт · документация · окружение · обвязка агента · рассуждения агента · сама задача
Доказательствоточные шаги траектории

Владелец — самое ценное поле, потому что отвечает на вопрос, который задаёт руководитель: кому это чинить. Если большинство трений висит на обвязке агента и окружении, а не на его рассуждениях — чинить надо не агентов. И это видно из отчёта без нашего вывода.

Честность метода

Короткий раздел, который мало кто пишет и который отличает нас от калькулятора-однодневки.

Три уровня доверия к любому числу. Verified — проверено по первичным источникам. Inferred — выведено косвенно, из доступного. Unverified — самооценка, слова клиента. Мы всегда пишем, какой это уровень, а не прячем его за красивой цифрой.

Глубина доступа D1–D4 — обязательна в шапке отчёта. Два честных аудита одной и той же системы могут дать разные числа — и оба правы в пределах увиденного.

УровеньЧто было доступно аудитору
D1 внешнийпубличные ответы: HTTP, открытые артефакты
D2 APIштатные интерфейсы, без внутренних таблиц
D3 кодисходники и конфигурация
D4 данныебаза, журналы событий, история, файлы сессий

Сравнивать допустимо только отчёты одной глубины. Меньший доступ — меньшая достоверность, и это пишется в отчёт, а не сглаживается. Коммерческий аудит целится в D4.

Анализ не меняет вердикт. Разобрав причину неудачи, оценку не переписывают. Это защита от нас самих: разбирая сессию, легко «дообъяснить» провал и незаметно поднять балл. Вердикт выносится один раз по фактам; свежий анализ читает те же следы и ищет причины, но цифру не трогает.

Частые вопросы

Что такое Индекс готовности автоматизации?

Это оценка того, насколько надёжно устроена автоматизация в вашей компании: что происходит при сбое, кто об этом узнаёт, можно ли откатить ошибку, где лежат секреты и не завязано ли всё на одном человеке. Итог — балл от 0 до 100 и буква от A до F.

Откуда взяты веса блоков?

За основу взята международная рубрика оценки автономности агентов (AMI/ARI). Мы переразвесили её под то, что реально ломается у российского среднего бизнеса: надёжность выполнения и данные/секреты весят по 20%, остальные четыре блока — по 15%.

Почему рядом с баллом написано «Unverified»?

Потому что это самооценка по вашим ответам, а не проверка. Мы сознательно показываем уровень доверия честно. Verified-оценку даём отдельно: приходим и проверяем по первичным источникам — логам, правам доступа, коду и хранилищу секретов.

Как считается оценка потерь в рублях?

Потери от ручного труда = часы в день × 21 рабочий день × 12 месяцев × 800 ₽/час. Потери от сбоев = число инцидентов за год × средняя цена инцидента (40 000 ₽ при балле ниже 40, 20 000 ₽ при 40–69, 8 000 ₽ при 70 и выше). Это оценка сверху; точную цифру считаем на разборе.

Мои ответы куда-то сохраняются?

Балл считается прямо в браузере — сервер в расчёте не участвует. Ваши ответы уходят к нам, только если вы сами оставите заявку на разбор: тогда они прикладываются к письму, чтобы менеджеру было с чего начать разговор.

Посчитайте свой балл

15 вопросов за 3 минуты. Балл, буква и оценка потерь — сразу, без регистрации.

Открыть калькулятор