05.04
Надёжность автоматизаций: ошибки, повторы, логи и human handoff
РЕЗУЛЬТАТ УРОКА
Спроектировать автоматизацию, которая не теряет работу при сбое.Главное за 30 секунд
Надёжность определяется не тем, что происходит при успехе, а тем, как система ведёт себя при неполных данных, недоступности сервиса и ошибке модели.
Разбираемся
Большинство автоматизаций проектируются для счастливого пути: всё пришло, все сервисы работают, данные корректны. Но в реальной эксплуатации появляются: некорректные входные данные, недоступные API, таймауты, неожиданные форматы ответов. Надёжная автоматизация — не та, которая никогда не ломается, а та, которая ломается предсказуемо и не теряет данные.
Ошибки входных данных
Пустые поля, неверный формат, значения вне ожидаемого диапазона. Проверяйте входные данные в начале workflow, до выполнения действий. Если данные некорректны — не пытайтесь угадать: отправьте уведомление с описанием проблемы и остановитесь.
Таймауты и недоступность сервисов
Внешний сервис может быть временно недоступен: плановое обслуживание, перегрузка, сетевая проблема. Для таких случаев нужна стратегия: подождать и повторить, поставить в очередь, уведомить оператора. Без обработки таймаутов workflow «зависает» или теряет данные молча.
Повторные попытки и идемпотентность
Повтор действия при ошибке — хорошая практика, но только если действие идемпотентно: повторный вызов не создаёт дублей. «Создать запись» — не идемпотентно: два вызова создадут два контакта. «Обновить запись» с конкретным ID — идемпотентно. Проектируйте действия с учётом повторов.
Логи и наблюдаемость
Хороший лог отвечает на три вопроса: что произошло, с какими данными, каков итог. Без логов невозможно понять, почему пришло три уведомления вместо одного или почему заявка пропала. Логируйте все важные события и ошибки — не только финальный результат.
Human handoff при сбое
Для критичных процессов — продажи, поддержка, финансы — ошибка автоматизации должна немедленно создавать задачу для человека с контекстом: что пришло, на каком шаге сломалось, что нужно сделать. Автоматизация без human handoff при сбое — это незаметно потерянные данные и клиенты.
ПРАКТИКА
Сделайте сейчас
Возьмите свой workflow из предыдущего урока. Добавьте три сценария отказа: некорректные входные данные, недоступность одного из сервисов, неожиданный формат ответа. Для каждого опишите: что должно произойти, кто получает уведомление, какие данные сохраняются для повторной обработки. Проверьте: можно ли восстановить процесс после каждого из трёх сбоев без потери данных?
ОГРАНИЧЕНИЯ
Где нужен человек
- Повтор без идемпотентности может создать дубли: лиды, письма, платежи — проверяйте каждое действие.
- Автоматизация без логов — это будущая загадка при первом сбое.
Ещё на уровне 05
Материал проверен: 20 августа 2026. Инструменты и тарифы меняются — сверяйтесь с первоисточником.