РАЗДЕЛ ЖУРНАЛА
Безопасность
Материалы с проверяемыми источниками, практическими выводами и понятным уровнем сложности.
- Аудит AgentGuard: тестируем блокировку инъекций и ложные срабатывания
Изучаем реализацию AgentGuard и прогоняем через нее прямые инъекции, командные конструкции, Unicode-обходы и контрольные безопасные примеры, оценивая код, а не обещания README.
- Защищаем инструменты AI-агента через MCP-прокси Doberman
Подключаем Doberman перед тестовым MCP-сервером и проверяем безопасную запись файла, разрушительную команду и попытку вывода секрета. Затем запускаем встроенный benchmark и оцениваем долю пропущенных атак и ложных блокировок.
- Проверяем защиту AI-агента от prompt injection
Практический аудит проекта AgenticAiSafety: создаём воспроизводимый adversarial-набор и отдельно тестируем prompt injection, jailbreak, анализ риска и контроль разрешений.
- Скрытая prompt injection: взламываем браузерного агента и проверяем защиту
Практический red-team-тест косвенной prompt injection: создаём вредоносный контент, фиксируем успешность атаки и проверяем изоляцию данных, подтверждение опасных действий и фильтрацию инструкций.
- Проверяем защитный шлюз для AI-агента: prompt injection, утечки и ложные блокировки
Репозиторий содержит рабочий reverse proxy, семь уровней проверок, демонстрационный сценарий, тесты и средства измерения. На его основе можно воспроизвести заявленные результаты и проверить защиту на собственном наборе прямых и косвенных prompt-injection атак.
- Проверяем локальную защиту агента от prompt injection с InjectionShield
Репозиторий дает основу для воспроизводимого теста rule-based детектора: собрать небольшой корпус атак, измерить precision и recall и сравнить фильтрацию с отсутствием защитного слоя.
- Защищаем терминал AI-агента с Vallum: проверка секретов и prompt injection
Подключаем Vallum к coding-агенту и прогоняем воспроизводимый набор безопасных и вредоносных команд, включая фиктивные токены, prompt injection в выводе и запрещенное правило проекта.
- Проверяем AI Guardrails: утечки PII, prompt injection и опасные ответы
Практический тест четырёх защитных механизмов WSO2: маскирования PII, обнаружения prompt injection, фильтрации контента и проверки галлюцинаций. Поведение шлюза сравнивается до и после включения каждой политики.