Как считается Индекс готовности автоматизации
Шесть измерений, веса под российский средний бизнес, честная шкала и формула потерь, которую можно проверить руками. Никакой магии — только арифметика и правила доказательства.
Что мы измеряем
Индекс отвечает на один вопрос: если ваша автоматизация завтра сломается, во что это обойдётся и узнаете ли вы об этом вовремя. Мы не оцениваем, «умная» ли она, — мы оцениваем, надёжная ли. Респондент не инженер, поэтому вопросы бытовые: «никто не узнает до утра» вместо «отсутствует alerting».
Оценка идёт по шести блокам. В каждом — два вопроса, за каждый ответ 0, 2, 3.5 или 5 баллов. Блок нормируется к своему весу, сумма даёт итог от 0 до 100.
Шесть измерений и веса
| Блок | Вес | Что проверяем |
|---|---|---|
| 1. Надёжность выполнения | 20% |
Что происходит, когда интеграция падает ночью? Как вы узнаёте, что она упала? |
| 2. Восстановление и повторы | 15% |
После сбоя операция повторяется сама — и не задвоит ли повтор счёт, заказ, письмо? Есть ли способ откатить неверно выполненную операцию? |
| 3. Права и доступы | 15% |
Может ли автоматизация сделать необратимое действие без человека? У скрипта отдельная учётка с минимумом прав — или админский доступ? |
| 4. Следы автономной работы | 20% |
Что автоматизация оставляет за собой из секретов — в логах, истории команд, вечных журналах? Что она оставляет за собой из чужих и персональных данных? |
| 5. Наблюдаемость | 15% |
Ответите за 5 минут, что именно система сделала вчера в 14:30? Хранятся ли логи и как долго? |
| 6. Зависимость от людей | 15% |
Что сломается, если завтра уйдёт человек, который это настраивал? Есть ли документация, по которой другой подрядчик подхватит? |
Надёжность выполнения и данные/секреты весят по 20% — здесь ломается дороже всего: незамеченный ночной сбой и утёкшие ключи стоят больше, чем неудобный лог. Остальные четыре блока — по 15%.
Как оцениваются ответы
У каждого вопроса четыре варианта, от худшего к лучшему. Им соответствуют баллы:
Итоговая шкала
Формулировки жёсткие сознательно. Мягкая оценка не продаёт и не запоминается: «работает, но держится на одном человеке» вы вспомните, а «есть зоны роста» — нет.
Оценка потерь в рублях
Балл показывает уровень риска, но мотивирует цифра. Три дополнительных вопроса переводят балл в деньги по простой и защитимой формуле:
Ставка 800 ₽/час — это полная стоимость сотрудника для работодателя, а не «зарплата в час». Цена инцидента и ставка вынесены в редактируемые константы: мы меняем их без правки кода, когда появляются более точные данные по вашей отрасли.
Оценка всегда сверху. Мы намеренно берём верхнюю границу и говорим об этом прямо. Точную цифру считаем на разборе — завышенная непрозрачная сумма убивает доверие ровно там, где мы его зарабатываем.
Правило доверия: Unverified и Verified
Рядом с результатом всегда стоит отметка Unverified — это самооценка по вашим ответам. Мы не прячем это за красивым числом. Verified-оценку мы даём отдельно: приходим и проверяем по первичным источникам — журналам действий, правам доступа, хранилищу секретов и коду. Разница между «я думаю, у нас так» и «проверено» — это и есть то, что мы продаём.
Аудируемость — почему без данных считать нечего
Прежде чем считать балл по фактам, надо ответить на предварительный вопрос: а есть ли что считать. Если не видно, что система запрашивала, что ответила и что после этого изменилось — считать нечего. И это не отказ, а первый вывод: вы управляете тем, чего не видите.
Мы проверяем восемь предпосылок. Каждая — это конкретный след, который система либо оставляет, либо нет.
| Код | Предпосылка | Что ищем |
|---|---|---|
| A1 | журнал обращений к модели | промпт, ответ, модель, время, инициатор |
| A2 | трассировка выполнения | цепочка задача → шаги → вызовы → результат |
| A3 | пооперационная стоимость | токены и деньги на конкретное действие |
| A4 | версия конфигурации | какой промпт и настройки действовали в момент события |
| A5 | идентификация актора | человек, расписание или другая система |
| A6 | срок хранения | записи старше 30 дней |
| A7 | связь действия с бизнес-фактом | статус «сделано» сопоставим с внешним подтверждением |
| A8 | доступ аудитора | чтение программно, без ручных выгрузок |
Предпосылки появляются вразнобой, поэтому мы не считаем их по порядку, а проверяем, какое множество целиком собралось. Отсюда пять уровней аудируемости — и то, что на каждом вообще можно вычислить:
| Уровень | Что собрано | Что вычислимо |
|---|---|---|
| L0 | нет доступа | ничего |
| L1 | A8 | только статусы |
| L2 | A8, A1, A5 | балл ИГА как verified |
| L3 | + A2, A6 | плюс ER и DV |
| L4 | все восемь | плюс PVG, полная проверка |
Метрику мы не публикуем без её предпосылки, даже если общий уровень достигнут. Нет журнала связи с фактом (A7) — нет PVG, каким бы правдоподобным ни было число. Это принципиально: показать метрику, под которой нет данных, — то же самое, что чинит наш индекс у клиентов.
A7 — единственная дыра, которую не закрывает ни один инструмент. Журналы платформ и нативные сессии агентов пишутся почти у всех и дают L3 из коробки. Но они записывают, что агент делал, а не к чему это привело — потому что инструмент не знает, что для вашего бизнеса ценность.
Инструменты записывают, что агент делал. Никто не записывает, к чему это привело. Мы соединяем два конца.
Шкала подтверждения P0–P5
PVG — разрыв между «система отчиталась» и «результат случился». Чтобы его посчитать, каждую закрытую задачу мы взвешиваем по тому, чем именно подтверждён её результат. Не все «выполнено» равны.
| Уровень | Чем подтверждено | Вес |
|---|---|---|
| P0 | статус поставил сам исполнитель | 0.0 |
| P1 | проверка другим агентом | 0.3 |
| P2 | выполнен чек-лист приёмки | 0.5 |
| P3 | подтвердил человек | 0.7 |
| P4 | факт исполнения — артефакт есть, письмо ушло, запись создана | 0.9 |
| P5 | факт ценности — заявка пришла, деньги получены, время высвободилось | 1.0 |
Почему подтверждение человеком слабее подтверждения фактом (0.7 против 0.9) — то, что читателю кажется странным. Пример из нашей практики, без имён: задача прошла проверку агентом, её подтвердил руководитель — и всё равно оказалась фантомом, потому что никто не выполнил одну проверочную команду. Человек подтверждает отчёт. Факт подтверждает результат.
И P4 не равен единице: исполнение без ценности — тоже фантом, просто убедительный. Страница опубликована, отдаёт 200 — и пустая. Только когда результат превратился в бизнес-факт (P5), задача перестаёт быть обещанием.
Границы: что мы НЕ меряем
Область аудита очерчена тремя правилами. Каждое отсекает то, что похоже на нашу работу, но ей не является.
Тест на автономность. Мысленно уберите из процесса автономную работу. Если метрика потеряла смысл — она наша. Если осталась осмысленной и без агентов — это не про автономность, и мы за это не беремся.
Правило причинности. Уберите агентов — дефект останется? Останется — он вне области. Мы меряем риск, который создаёт автономная работа, а не общий беспорядок в системе, который был до неё и будет после.
Граница с пентестом. Риск от действий самой системы — наш. Риск от действий внешнего атакующего — не наш. Мы не ищем, как злоумышленник взломает ваш периметр; мы смотрим, что натворит ваш собственный агент, действуя штатно.
Находки вне области. Всё, что мы замечаем за границей — уязвимость, юридический риск, кривой процесс, — мы честно называем и передаём, но не оцениваем и не тащим в балл. Аудитор, который говорит «это не моё», вызывает больше доверия, чем тот, кто во всём нашёл работу для себя.
Два способа: аудит и испытание
Индекс один, а измерить его можно двумя путями. Врач может изучить вашу медкарту или отправить на нагрузочный тест — диагноз про одно сердце, способы разные.
| Аудит | Испытание | |
|---|---|---|
| Что делаем | смотрим следы прошлой работы | даём контрольные задачи |
| Требует | аудируемость L2 и выше | возможность запустить систему |
| Даёт | PVG по прошлому | PVG по свежим прогонам |
| Стоит | часы | дни плюс расход на прогоны |
| Слабость | меряет прошлое | искусственные задачи могут не совпасть с реальными |
Испытание — это не отдельная строка прайса, а способ выполнить тот же аудит, когда истории ещё нет: система новая или только что переделана. Среда испытания подчиняется четырём правилам:
Почему переиспользованная песочница завышает результат. Она протекает подсказками из прошлых прогонов: агент «уже знает» ответ не потому, что справился, а потому, что окружение сохранило след прошлой попытки. Доля успеха выходит красивее реальности — и мы бы приняли этот шум за сигнал.
Трения — кому это чинить
Доля успеха говорит, как часто агент справляется. Трение — что именно ему помешало в конкретном прогоне. Это отдельная сущность, и записываем её по пяти полям:
| Поле | Что фиксирует |
|---|---|
| Семейство | тип препятствия, чтобы повторы складывались в одну проблему |
| Тяжесть | во что обошлось — от небольшого крюка до провала задачи |
| Преодоление | агент обошёл препятствие или встал |
| Владелец | кто может починить: продукт · документация · окружение · обвязка агента · рассуждения агента · сама задача |
| Доказательство | точные шаги траектории |
Владелец — самое ценное поле, потому что отвечает на вопрос, который задаёт руководитель: кому это чинить. Если большинство трений висит на обвязке агента и окружении, а не на его рассуждениях — чинить надо не агентов. И это видно из отчёта без нашего вывода.
Честность метода
Короткий раздел, который мало кто пишет и который отличает нас от калькулятора-однодневки.
Три уровня доверия к любому числу. Verified — проверено по первичным источникам. Inferred — выведено косвенно, из доступного. Unverified — самооценка, слова клиента. Мы всегда пишем, какой это уровень, а не прячем его за красивой цифрой.
Глубина доступа D1–D4 — обязательна в шапке отчёта. Два честных аудита одной и той же системы могут дать разные числа — и оба правы в пределах увиденного.
| Уровень | Что было доступно аудитору |
|---|---|
| D1 внешний | публичные ответы: HTTP, открытые артефакты |
| D2 API | штатные интерфейсы, без внутренних таблиц |
| D3 код | исходники и конфигурация |
| D4 данные | база, журналы событий, история, файлы сессий |
Сравнивать допустимо только отчёты одной глубины. Меньший доступ — меньшая достоверность, и это пишется в отчёт, а не сглаживается. Коммерческий аудит целится в D4.
Анализ не меняет вердикт. Разобрав причину неудачи, оценку не переписывают. Это защита от нас самих: разбирая сессию, легко «дообъяснить» провал и незаметно поднять балл. Вердикт выносится один раз по фактам; свежий анализ читает те же следы и ищет причины, но цифру не трогает.
Частые вопросы
Что такое Индекс готовности автоматизации?
Это оценка того, насколько надёжно устроена автоматизация в вашей компании: что происходит при сбое, кто об этом узнаёт, можно ли откатить ошибку, где лежат секреты и не завязано ли всё на одном человеке. Итог — балл от 0 до 100 и буква от A до F.
Откуда взяты веса блоков?
За основу взята международная рубрика оценки автономности агентов (AMI/ARI). Мы переразвесили её под то, что реально ломается у российского среднего бизнеса: надёжность выполнения и данные/секреты весят по 20%, остальные четыре блока — по 15%.
Почему рядом с баллом написано «Unverified»?
Потому что это самооценка по вашим ответам, а не проверка. Мы сознательно показываем уровень доверия честно. Verified-оценку даём отдельно: приходим и проверяем по первичным источникам — логам, правам доступа, коду и хранилищу секретов.
Как считается оценка потерь в рублях?
Потери от ручного труда = часы в день × 21 рабочий день × 12 месяцев × 800 ₽/час. Потери от сбоев = число инцидентов за год × средняя цена инцидента (40 000 ₽ при балле ниже 40, 20 000 ₽ при 40–69, 8 000 ₽ при 70 и выше). Это оценка сверху; точную цифру считаем на разборе.
Мои ответы куда-то сохраняются?
Балл считается прямо в браузере — сервер в расчёте не участвует. Ваши ответы уходят к нам, только если вы сами оставите заявку на разбор: тогда они прикладываются к письму, чтобы менеджеру было с чего начать разговор.
Посчитайте свой балл
15 вопросов за 3 минуты. Балл, буква и оценка потерь — сразу, без регистрации.
Открыть калькулятор →