Реагирование на инциденты
Жизненный цикл реагирования (PICERL) — событие против инцидента, изоляция против наблюдения, таймлайн атаки, разбор фишинга, оценка масштаба, ransomware-плейбук, chain of custody и уведомления.
13 вопросов
JuniorТеорияОчень частоЧем событие отличается от алерта и от инцидента безопасности?
Чем событие отличается от алерта и от инцидента безопасности?
Событие — любое наблюдаемое действие, например вход или запись. Алерт — событие, помеченное правилом как подозрительное. Инцидент — подтверждённое или вероятное нарушение безопасности. Триаж — решение аналитика, поднимающее алерт в инцидент.
Типичные ошибки
- ✗Называть инцидентом каждый алерт, раздувая статистику и выжигая команду
- ✗Считать инцидентами только простои, из-за чего тихая кража данных не объявляется
- ✗Считать повышение до инцидента автоматическим, а не решением аналитика
Уточняющие вопросы
- →Какие входные данные триажа решают, станет ли алерт инцидентом?
- →Как классификация критичности меняет, кого и когда поднимают по тревоге?
JuniorТеорияОчень частоКакие фазы образуют жизненный цикл реагирования на инциденты и почему подготовка решает исход?
Какие фазы образуют жизненный цикл реагирования на инциденты и почему подготовка решает исход?
Подготовка, обнаружение и анализ, сдерживание, устранение, восстановление, разбор уроков. Подготовка решает исход, потому что логи, runbook, резервные копии и полномочия нельзя создать по ходу — заранее сделанное ограничивает все поздние фазы.
Типичные ошибки
- ✗Считать подготовку бумагами для аудита, а не фазой, задающей потолок возможностей
- ✗Пропускать разбор уроков после восстановления сервиса, повторяя тот же пробел
- ✗Думать, что недостающую телеметрию можно добыть уже после начала инцидента
Уточняющие вопросы
- →Какие артефакты должны существовать до инцидента, чтобы фаза анализа вообще работала?
- →Почему безвинностный разбор — формат postmortem без поиска виноватых — лучше вскрывает пробелы?
JuniorТеорияЧастоЧто такое таймлайн атаки и что означают на нём dwell time и patient zero?
Что такое таймлайн атаки и что означают на нём dwell time и patient zero?
Таймлайн выстраивает подтверждённые действия злоумышленника по единым часам, обычно UTC. Dwell time — интервал между первой компрометацией и обнаружением. Patient zero — первый скомпрометированный хост или учётка: без него охват недостоверен.
Типичные ошибки
- ✗Смешивать локальные метки времени разных источников без приведения к UTC
- ✗Понимать dwell time как время до сдерживания, а не от компрометации до обнаружения
- ✗Называть patient zero самый шумный заражённый хост, не доказав, что он был первым
Уточняющие вопросы
- →Как расхождение часов и часовые пояса портят таймлайн из нескольких источников?
- →Почему длинный dwell time расширяет охват, который придётся расследовать?
JuniorТеорияЧастоЧем краткосрочное сдерживание отличается от долгосрочного и чего стоит изоляция хоста?
Чем краткосрочное сдерживание отличается от долгосрочного и чего стоит изоляция хоста?
Краткосрочное сдерживание останавливает ущерб сейчас — изолировать хост, отключить учётку. Долгосрочное — устойчивая мера на время устранения. Поспешная изоляция губит волатильные улики и выдаёт активного злоумышленника, поэтому сначала снимают память.
Типичные ошибки
- ✗Выключать хост ради сдерживания и терять улики, живущие только в памяти
- ✗Считать, что изоляция незаметна для злоумышленника, который сейчас за клавиатурой
- ✗Принимать краткосрочное сдерживание за окончательное решение и не делать устойчивого
Уточняющие вопросы
- →Когда вы осознанно оставите скомпрометированный хост под наблюдением вместо изоляции?
- →Какой порядок сбора сохраняет волатильные улики до отключения сети?
JuniorТеорияЧастоЧем устранение отличается от восстановления и когда хост переустанавливают, а не чистят?
Чем устранение отличается от восстановления и когда хост переустанавливают, а не чистят?
Устранение убирает злоумышленника — закрепление, импланты и вектор входа — и ротирует учётные данные, которые он мог забрать. Восстановление возвращает сервис из чистого состояния под наблюдением. При компрометации уровня системы хост переустанавливают.
Типичные ошибки
- ✗Удалить ВПО, но оставить закрепление и исходный вектор входа открытыми
- ✗Пропустить ротацию учётных данных, и злоумышленник вернётся с украденными секретами
- ✗Чистить хост с компрометацией уровня ядра или SYSTEM вместо переустановки
Уточняющие вопросы
- →Какие учётные данные считаются скомпрометированными при взломе рабочей станции?
- →Какое наблюдение вы добавите на возвращённый в строй хост и на какой срок?
JuniorДебаггингЧастоПользователь переслал это письмо в почтовый ящик безопасности — разберите заголовки и вынесите вердикт.
Пользователь переслал это письмо в почтовый ящик безопасности — разберите заголовки и вынесите вердикт.
SPF, DKIM и DMARC не проходят для заявленного отправителя — заголовок From подделан. Имя говорит Billing, а домен — двойник paypa1 с цифрой один, Reply-To ведёт на чужой ящик, тема создаёт срочность. Заводите как фишинг, сохраните заголовки.
Открыть задачу →Типичные ошибки
- ✗Считать, что доставка в ящик означает прохождение проверок подлинности
- ✗Принимать домен-двойник за легитимный партнёрский или доставочный поддомен
- ✗Удалять письмо до того, как сырые заголовки сохранены как улика
Уточняющие вопросы
- →Что вы будете искать, чтобы найти остальных получателей той же рассылки?
- →Почему политика почтовой аутентификации
DMARCсо значением reject у подделанного домена здесь важна?
SeniorДизайнЧасто02:40. Файловый сервер с финансовой шарой шифрует файлы, на трёх рабочих станциях та же записка о выкупе. Резервные копии ночные, на NAS в том же домене. У вас два реагирующих, дежурный доменный администратор и юрист только утром. Совет директоров потом спросит, верно ли оценён охват. Спроектируйте план сдерживания на ближайшие два часа: что отключаете и в каком порядке, что снимаете до отключения, как не уничтожить улики, нужные для поиска первичного доступа, и как понять, что злоумышленник ещё за клавиатурой. Укажите допущения и точки эскалации.
02:40. Файловый сервер с финансовой шарой шифрует файлы, на трёх рабочих станциях та же записка о выкупе. Резервные копии ночные, на NAS в том же домене. У вас два реагирующих, дежурный доменный администратор и юрист только утром. Совет директоров потом спросит, верно ли оценён охват. Спроектируйте план сдерживания на ближайшие два часа: что отключаете и в каком порядке, что снимаете до отключения, как не уничтожить улики, нужные для поиска первичного доступа, и как понять, что злоумышленник ещё за клавиатурой. Укажите допущения и точки эскалации.
Сначала снимаем волатильное состояние — память и сессии файлового сервера и одной станции, — затем изолируем по сети, а не выключаем питание. Выводим NAS из домена ради бэкапов, отключаем подозрительные учётки, эскалируем при активности после изоляции.
Типичные ошибки
- ✗Выключать хосты по питанию, теряя ключи, сессии и состояние процессов из памяти
- ✗Оставлять резервные копии достижимыми из скомпрометированного домена во время сдерживания
- ✗Объявлять охватом три известных хоста, не поискав первичный доступ
Уточняющие вопросы
- →Какие признаки говорят, что злоумышленник работает вживую, а не это автоматическая нагрузка?
- →Как изменится план, если шифрование дошло до сервиса под управлением подрядчика?
MiddleТеорияИногдаЧто такое chain of custody для цифровых улик и что делает такие улики защитимыми?
Что такое chain of custody для цифровых улик и что делает такие улики защитимыми?
Chain of custody — непрерывная подписанная запись, кто держал улику, когда и зачем. Улика защитима, если снять хеш оригинала, работать только с копией, пересчитать хеш и доказать неизменность, а каждую передачу фиксировать со временем и ответственным.
Типичные ошибки
- ✗Анализировать оригинальный носитель вместо проверенной рабочей копии
- ✗Снимать хеш только после анализа — это ничего не доказывает об исходном состоянии
- ✗Оставлять передачи улики между реагирующими без документирования
Уточняющие вопросы
- →Что такое порядок волатильности и почему память снимают раньше диска?
- →Кто решает, что обращение с уликами должно отвечать юридическому, а не внутреннему стандарту?
MiddleТеорияИногдаЗачем нужны штабные учения tabletop и что на самом деле проверяет хороший сценарий?
Зачем нужны штабные учения tabletop и что на самом деле проверяет хороший сценарий?
Tabletop — разбор инцидента за столом, без действий в реальных системах. Цель — найти пробелы плана, пока они дёшевы. Хороший сценарий проверяет решения, а не факты: кто объявляет инцидент, кто вправе гасить прод, когда извещают юристов и клиентов.
Типичные ошибки
- ✗Проводить tabletop как проверку знаний, а не как репетицию решений
- ✗Не звать юристов, PR и руководство, из-за чего пробелы коммуникаций остаются скрытыми
- ✗Путать tabletop с боевой технической симуляцией в реальных системах
Уточняющие вопросы
- →Какой результат tabletop превращается в реальное изменение в runbook?
- →Как построить сценарий, нагружающий вопрос полномочий в нерабочее время?
MiddleДебаггингИногдаЧетыре источника расходятся во времени — выстройте действия злоумышленника в истинном порядке.
Четыре источника расходятся во времени — выстройте действия злоумышленника в истинном порядке.
Сначала приводим к UTC и правим часы: файловый сервер спешит на 47 минут, поэтому его 09:52 +03:00 — это 06:05Z. Истинный порядок: вход по VPN 05:58Z, чтение файлов 06:05Z, установка службы 06:15Z, затем выгрузка 1.4 ГБ в 06:22Z.
Открыть задачу →Типичные ошибки
- ✗Сортировать по напечатанным цифрам, не переведя смещения зон в UTC
- ✗Прибавлять дрейф спешащих часов вместо того, чтобы его вычесть
- ✗Выбрасывать источник с расхождением вместо коррекции на измеренное смещение
Уточняющие вопросы
- →Как измерить и зафиксировать смещение часов хоста, чтобы коррекция была защитимой?
- →Какой дополнительный источник подтвердит, что вход по VPN был первичным доступом?
SeniorДизайнИногдаКоманда подтвердила: из-за ошибки конфигурации экспорта была доступна таблица с именами, email и адресами доставки 40 000 клиентов, среди них резиденты ЕС и российские пользователи. Утечка длилась девять дней, логи доступа неполные. Вечер пятницы. Маркетинг хочет молчать до понедельника, в поддержку уже идут вопросы, а у одного корпоративного клиента в договоре срок уведомления 24 часа. Спроектируйте план уведомлений: кого извещают внутри и в каком порядке, что и когда сообщают регулятору и клиентам, как формулируете неопределённость из-за неполных логов.
Команда подтвердила: из-за ошибки конфигурации экспорта была доступна таблица с именами, email и адресами доставки 40 000 клиентов, среди них резиденты ЕС и российские пользователи. Утечка длилась девять дней, логи доступа неполные. Вечер пятницы. Маркетинг хочет молчать до понедельника, в поддержку уже идут вопросы, а у одного корпоративного клиента в договоре срок уведомления 24 часа. Спроектируйте план уведомлений: кого извещают внутри и в каком порядке, что и когда сообщают регулятору и клиентам, как формулируете неопределённость из-за неполных логов.
Сначала эскалация руководству и юристам: регуляторные сроки ведут юристы, GDPR ждёт уведомления надзорного органа в течение 72 часов с момента осведомлённости. Клиента извещают в его договорные 24 часа, пользователям — какие данные и риск, а про неполные логи говорят прямо.
Типичные ошибки
- ✗Отдавать регуляторные сроки уведомления маркетингу, а не юристам
- ✗Считать неполные логи основанием отложить уведомление или отрицать утечку
- ✗Игнорировать договорные сроки уведомления, которые короче законных
Уточняющие вопросы
- →Чем обязанность уведомления отличается, если вы обработчик, а не оператор данных?
- →Какие формулировки сохраняют честность заявления, пока охват известен лишь как верхняя оценка?
SeniorТеорияИногдаКогда безопасно объявить инцидент устранённым и восстановленным?
Когда безопасно объявить инцидент устранённым и восстановленным?
Только когда найден первичный доступ и весь радиус поражения — учётки, хосты и токены злоумышленника, — и закрыт сам вектор, а не симптом. Охват определяют по поведению атакующего, а не по первому списку индикаторов, а скомпрометированные секреты ротируют.
Типичные ошибки
- ✗Объявлять восстановление, пока первичный доступ так и не найден
- ✗Определять охват по первому списку индикаторов, а не по поведению злоумышленника
- ✗Переустановить хосты, оставив украденные учётные данные и токены действующими
Уточняющие вопросы
- →Почему охват по поведению находит больше, чем список индикаторов компрометации?
- →Какое усиленное наблюдение вы оставите после формального закрытия инцидента?
SeniorДизайнИногдаВы приходите первым инженером по безопасности в продуктовую компанию на 25 человек. Плана реагирования нет: алерты падают в общий ящик, доступ в прод есть у всех, а прошлый сбой разбирал тот, кто заметил. Руководство даёт квартал вашего времени. Спроектируйте план реагирования: роли и кто их занимает в такой маленькой команде, как и кем объявляется инцидент, у кого полномочия погасить прод, каналы связи с руководством, юристами и клиентами, как вы будете его репетировать и пересматривать. Объясните, что осознанно не входит в первую версию и почему.
Вы приходите первым инженером по безопасности в продуктовую компанию на 25 человек. Плана реагирования нет: алерты падают в общий ящик, доступ в прод есть у всех, а прошлый сбой разбирал тот, кто заметил. Руководство даёт квартал вашего времени. Спроектируйте план реагирования: роли и кто их занимает в такой маленькой команде, как и кем объявляется инцидент, у кого полномочия погасить прод, каналы связи с руководством, юристами и клиентами, как вы будете его репетировать и пересматривать. Объясните, что осознанно не входит в первую версию и почему.
Назначьте руководителя инцидента на смену, отдельно от исполнителя, с явным правом гасить прод. Определите единый канал объявления и шкалу критичности, решающую, кого поднимать. Напишите короткие runbook на два вероятных сценария, репетируйте и правьте.
Типичные ошибки
- ✗Не закрепить полномочия, из-за чего никто не решается остановить прод
- ✗Писать исчерпывающий набор playbook, который никто не читает, вместо двух рабочих runbook
- ✗Считать план готовым в момент публикации и никогда его не репетировать
Уточняющие вопросы
- →Как сохранить роль руководителя инцидента, если дежурных всего трое?
- →Что меняется в плане, если инцидент возник на стороне подрядчика?