Единицы
1. Введение в искусственный интеллект в кибербезопасности: роли, границы, оборонная этика и проверка 2. Анализ журналов и SIEM: отделение событий от шума с помощью искусственного интеллекта 3. Охота за угрозами: выдвижение гипотез и поиск сигналов с помощью искусственного интеллекта 4. Сканирование уязвимостей и приоритезация: правильная сортировка с помощью CVE, CVSS, EPSS и контекста 5. Реагирование на инциденты: быстрый анализ, сценарий и контролируемое решение с помощью искусственного интеллекта 6. Анализ фишинга и социальной инженерии: обзор электронной почты, URL-адресов и заголовков 7. Обзор безопасного кода и статический анализ: поиск уязвимостей с помощью искусственного интеллекта 8. Разведка угроз: IOC, TTP, MITRE ATT&CK и Sensemaking с искусственным интеллектом 9. Отчетность и коммуникация: от выводов к техническим отчетам и резюме 10. Границы, конфиденциальность, этика и запрет на несанкционированное использование 11. Комплексный рабочий процесс SOC, автоматизация (SOAR), управление качеством и самоаудит
Единица 2 / 11

Анализ журналов и SIEM: отделение событий от шума с помощью искусственного интеллекта

Прибыль:

  • Поймите, что искусственный интеллект суммирует и группирует тысячи строк журнала, устанавливает временную шкалу и выделяет подозрительные закономерности, но аналитик решает, что событие является настоящей атакой с помощью необработанного журнала.
  • Возможность применять базовый уровень (нормальное поведение) при оценке сигнала тревоги SIEM, а также способы устранения ложных срабатываний без контекста и невозможность интерпретации аномалии.
  • Возможность приобрести привычку проверять цепочку событий, установленную искусственным интеллектом, в необработанном журнале и удалять ложные корреляции.

Аналитик безопасности проводит большую часть своего дня за чтением журналов. Журнал — это строка текста, в которой отмечаются временные метки того, что произошло в системе: кто, когда входил в систему, к какому файлу обращались, какое соединение было отклонено. Проблема не в том, что бревна слишком мало, а в том, что его так много, что оно задыхается. Организация среднего размера производит сотни миллионов строк журналов в день. В этой куче следом настоящего нападения является иголка в стоге сена. SIEM (Информация о безопасности и управление событиями — система, которая собирает и сопоставляет журналы из разных источников в едином центре и выдает сигналы тревоги на основе правил) призвана найти эту иголку; но большинство сигналов тревоги, генерируемых SIEM, также являются ложными срабатываниями (бесполезные сигналы тревоги, которые на самом деле не являются угрозами). Настоящая работа аналитика — извлечь из этого шума настоящий сигнал.

Искусственный интеллект — мощный помощник в этой сортировке. Он может прочитать тысячи строк журнала за секунды и обобщить их на человеческом языке, сгруппировать повторяющиеся закономерности, описать цепочку событий как «сначала произошло это, потом то» и объяснить, почему сигнал тревоги кажется подозрительным. Но ИИ не знает, что означает лог в контексте учреждения: «доступ в 3 часа ночи» — это атака в одном учреждении, ночная смена — в другом. Таким образом, ИИ обобщает и помечает журнал, а аналитик решает, является ли событие настоящей атакой, и сверяет его с необработанным журналом.

Этапы анализа журнала

Вот как можно выполнить пошаговый анализ журнала/SIEM с помощью ИИ:

  1. Соберите и анонимизируйте. Удалить соответствующий фрагмент журнала; замените фактические IP-адреса, имена пользователей, внутренние имена хостов заполнителями (USER_A, IC_IP_1). Никогда не экспортируйте необработанные данные во внешний инструмент в том виде, в котором они есть.
  2. Дайте контекст. Сообщите ИИ источник журнала (брандмауэр, журнал событий Windows, веб-сервер), что такое нормальное поведение и что вы ищете. Анализ журналов без контекста вводит в заблуждение.
  3. Обобщить и агрегировать. Попросите ИИ сгруппировать тысячи строк по типам событий, извлечь количество повторений и создать временную шкалу.
  4. Отмечать подозрительные закономерности. Выделите такие шаблоны, как «один успешный вход после неудачных входов в систему», «множество обращений к файлам за короткий период времени», «сетевое соединение, принадлежащее неизвестному процессу».
  5. Подтвердите необработанными доказательствами. Найдите и подтвердите каждую закономерность, которую ИИ отмечает в фактических строках журнала. Также просканируйте сами области, которые пропускает ИИ.
  6. Решение и регистрация. Объявите фактическое событие как аналитик, откройте заявку и задокументируйте, что ИИ — это всего лишь ускоритель.

Несколько терминов: Источник журнала — это система, которая создает журнал. Корреляция — это объединение событий из разных источников и их осмысление (вход в VPN + доступ к файлам + передача данных = возможная утечка). Базовый уровень — это мера нормального поведения системы; Аномалия имеет смысл только относительно базовой линии. UEBA (Аналитика поведения пользователей и объектов) — это подход на основе искусственного интеллекта, который изучает нормальное поведение каждого пользователя и отмечает отклонения.

сравнительная таблица

Подход

Как это работает

сильная сторона

слабость

SIEM на основе правил

Исправлены правила «если-то».

Прозрачный, объяснимый

Пропускает неизвестную атаку, много ложных срабатываний

Обнаружение на основе сигнатур

Соответствует известному неправильному шаблону

Быстро реагируйте на известную угрозу

Слепой к новым/измененным атакам

Аномалия/UEBA (ИИ)

Находит отклонения от нормы

Может запечатлеть неизведанное

Аномалия = не атаковать; риск ложных срабатываний

Подведение итогов с помощью ИИ

Обобщает журнал на языке

Скорость, читабельность

Без контекста, риск галлюцинаций

Аналитик (человек)

Комментарии с контекстом

решение, ответственность

Медленный, устает, не масштабируется

Правильная настройка — не выбирать что-то одно, а накладывать слои: SIEM и сигнатура грубо фильтруют шум, ИИ суммирует и выделяет, аналитик проверяет и принимает решение.

три мини-кейса

Случай 1 — 50 000 строк, 6 минут. Аналитик анонимизирует 50 000 строк журналов доступа с веб-сервера к ИИ. ИИ делает вывод, что один внешний IP-адрес просканировал /admin маршруты с 12 000 запросов за 3 часа, попробовал 480 различных параметров и получил 200 ответов 3 раза. Аналитик находит эти три успешных запроса в необработанном журнале, проверяет, что это настоящая атака с перечислением путей, и блокирует IP-адрес. Чтение 50 000 строк вручную заняло бы часы; Краткое содержание сократило его до 6 минут, но это было решение аналитика.

Случай 2 — Надуманная корреляция. Другой аналитик просит ИИ: «Опишите в этом журнале цепочку атак». ИИ создает гибкую историю: «В 02:11 USER_B повысил привилегии и экспортировал данные». Аналитик открывает необработанный журнал перед записью его в отчет; тогда как в журнале нет ни повышения привилегий, ни передачи данных — модель укладывает типичную цепочку событий в «историю атаки». Аналитик извлекает утверждение. Урок: Каждая цепочка, которую сообщает ИИ, должна быть проверена в журнале.

Случай 3 — Ложное срабатывание ночной смены. Модель UEBA помечает пользователя, получившего доступ к 900 файлам в 3 часа ночи, как «аномалию высокого риска». Аналитик проверяет контекст: пользователь является оператором резервного копирования, и это задание запускается каждую ночь в 03:00; Базовый уровень не рассматривался. Тревога является ложноположительной. Аналитик устанавливает правило и добавляет этот оператор в список исключений. Аномалия не всегда является атакой; Без контекста тревога — это шум.

Слабая подсказка / Сильная подсказка

Слабая подсказка:

Изучите этот лог, сообщите, есть ли атака. [10.14.2.7 - ahmet.yilmaz - 200 - /admin ...]

Это приглашение содержит реальный IP-адрес и пользователя (нарушение конфиденциальности), не сообщает источник журнала и нормальное поведение, не запрашивает у ИИ доказательства и ложноположительную оценку. ИИ может ввести вас в заблуждение одним предложением: «Да, атака есть».

Мощная подсказка:

Ваша роль: Помощник аналитика SOC, готовящего ПРОЕКТ анализа. Не решайте, не объявляйте атаку. Это анонимный журнал доступа к веб-серверу (IP-адреса и пользователи замаскированы). Обычный трафик: 100-300 запросов/час в рабочее время, в основном маршруты /product и /cart. Ваша задача: (1) сгруппировать события по типу и источнику, указать количество вхождений, (2) шаблоны флагов, отклоняющиеся от базового уровня, (3) показать для каждого флага, на каких строках журнала он основан, (4) записать вероятность ложного срабатывания для каждого и почему. Монтажная линия/вставка IOC; Отметьте «[подтвердить аналитик]», если вы не уверены. [анонимный журнал здесь]

Сильное утверждение ограничивает роль, обеспечивает контекст и исходные данные и требует привлечения доказательств и оценки ложных срабатываний.

Копируемые шаблоны подсказок

ШАБЛОН СВОДКИ ЖУРНАЛА Следующий анонимный [источник журнала: например. Обобщите журнал [брандмауэра]: (1) сгруппируйте по типам событий и укажите количество случаев каждой группы, (2) извлеките количество уникальных источников/целей, (3) установите временную шкалу (первое последнее событие, часы пик), (4) перечислите 5 заметных аномалий с линией доказательств. Принятие решений; просто вкратце. Журнал: [вставить]

ШАБЛОН КОРРЕЛЯЦИИ Сопоставьте анонимные события во времени и сущности и постройте возможную цепочку событий; НО для каждого шага укажите, на какой строке журнала он основан, и пометьте шаг, не имеющий основания, как «[нет основания — необходимо проверить]». Напишите также альтернативное объяснение с благими намерениями. События: [вставить]

ШАБЛОН УСТРАНЕНИЯ ЛОЖНО-ПОЛОЖИТЕЛЬНЫХ ДАВЛЕНИЙ Для этого сигнала тревоги создайте как минимум 3 благонамеренных (ложноположительных) объяснения интерпретации атаки и запишите, какие дополнительные журналы/доказательства мне нужно просмотреть, чтобы проверить каждое из них. Затем определите, какие дополнительные доказательства говорят в пользу нападения, а какие — против него. Будильник: [вставить]

ШАБЛОН ИЗВЛЕЧЕНИЯ ВРЕМЕННОЙ ЛИНИИ: Из этих анонимных журналов извлекается единая хронологическая временная шкала: каждая строка в формате [время] [объект] [событие] [исходный журнал]. Добавление события без метки времени. Не восполняйте пробелы; Если отсутствует, напишите «[отсутствует]». Журналы: [вставить]

Распространенные ошибки

  • Анализ без контекста. Комментарии, сделанные без упоминания источника журнала и нормального поведения (базового уровня), вводят в заблуждение; «аномалия» приобретает значение в зависимости от контекста.
  • Не проверяя цепочку, установленную ИИ. Модель может связать обычные события с историей нападения; Подтверждайте каждый шаг в необработанном журнале.
  • Принимаем аномалию за атаку. Признак UEBA – это гипотеза; Устраните невинные причины, такие как резервное копирование, обслуживание, новое программное обеспечение.
  • Экспорт необработанных данных без маскировки. Реальный IP/пользователь/хост является одновременно нарушением KVKK и подарком карты сети злоумышленнику.
  • Не доверяйте негативному резюме и прекратите просмотр. Запускайте собственный систематический запрос (типы критических инцидентов, новые IOC), даже если ИИ говорит «ничего важного».
Совет: всегда просите «показать строку доказательств», когда ИИ подводит итоги журнала. Не воспринимайте всерьез какие-либо выводы без каких-либо доказательств; Это единственное правило исключает большинство галлюцинаций.
Внимание: отключение оповещения SIEM только потому, что ИИ сообщил «ложное срабатывание», может скрывать реальную атаку. Также самостоятельно проверьте тревогу, которую ИИ называет «неважной»; Решение о закрытии принадлежит аналитику и фиксируется.

В заключение

Суть лога и SIEM-анализа заключается в извлечении реального сигнала из огромной кучи шума. При такой сортировке ИИ суммирует журнал за секунды, группирует закономерности, устанавливает временную шкалу и выделяет подозреваемого, но не знает институционального контекста и может выдумывать события. Таким образом, правильная настройка является многоуровневой: правило/сигнатура грубо просеивает, ИИ обобщает и помечает, аналитик сверяется с необработанным журналом и принимает решение. Вас защищают три принципа: контекст (никакая аномалия не интерпретируется без базовой линии), доказательства (каждая находка привязана к необработанной строке журнала), независимый контроль (также сканируется то, что ИИ называет «чистой» областью). И всегда работайте анонимно.

Задача приложения

Возьмите образец журнала (анонимизированный из вашей собственной системы или из образца набора данных). Сначала передайте данные AI с помощью шаблона «Суммирование журналов». Затем примените шаблон «Устранение ложноположительных результатов» для каждого из трех наиболее заметных результатов и проверьте каждый результат самостоятельно в необработанном журнале. Наконец, обратите внимание на различия между резюме ИИ и вашим необработанным чтением: что ИИ пропустил, что он составил, что он понял правильно?

контрольный список

  • [ ] Я анонимизировал журнал; реальный IP/пользователь/хост замаскирован.
  • [ ] Я дал ИИ источник журнала и нормальное поведение (базовый уровень).
  • [ ] Я запросил строку журнала доказательств для каждого открытия и проверил ее в необработанном журнале.
  • [ ] Я подтвердил каждый шаг цепочки событий, установленной ИИ, отсеивая выдумки.
  • [ ] Я рассмотрел как минимум одно ложноположительное объяснение для каждого сигнала тревоги.
  • [ ] Я также просканировал области, которые ИИ называет «чистыми/неважными».
  • [ ] Как аналитик, я принял решение и записал инцидент; Я задокументировал ИИ как ускоритель.