РАЗДЕЛ ЖУРНАЛА

Безопасность

Материалы с проверяемыми источниками, практическими выводами и понятным уровнем сложности.

  1. Аудит AgentGuard: тестируем блокировку инъекций и ложные срабатывания

    Изучаем реализацию AgentGuard и прогоняем через нее прямые инъекции, командные конструкции, Unicode-обходы и контрольные безопасные примеры, оценивая код, а не обещания README.

  2. Защищаем инструменты AI-агента через MCP-прокси Doberman

    Подключаем Doberman перед тестовым MCP-сервером и проверяем безопасную запись файла, разрушительную команду и попытку вывода секрета. Затем запускаем встроенный benchmark и оцениваем долю пропущенных атак и ложных блокировок.

  3. Проверяем защиту AI-агента от prompt injection

    Практический аудит проекта AgenticAiSafety: создаём воспроизводимый adversarial-набор и отдельно тестируем prompt injection, jailbreak, анализ риска и контроль разрешений.

  4. Скрытая prompt injection: взламываем браузерного агента и проверяем защиту

    Практический red-team-тест косвенной prompt injection: создаём вредоносный контент, фиксируем успешность атаки и проверяем изоляцию данных, подтверждение опасных действий и фильтрацию инструкций.

  5. Проверяем защитный шлюз для AI-агента: prompt injection, утечки и ложные блокировки

    Репозиторий содержит рабочий reverse proxy, семь уровней проверок, демонстрационный сценарий, тесты и средства измерения. На его основе можно воспроизвести заявленные результаты и проверить защиту на собственном наборе прямых и косвенных prompt-injection атак.

  6. Проверяем локальную защиту агента от prompt injection с InjectionShield

    Репозиторий дает основу для воспроизводимого теста rule-based детектора: собрать небольшой корпус атак, измерить precision и recall и сравнить фильтрацию с отсутствием защитного слоя.

  7. Защищаем терминал AI-агента с Vallum: проверка секретов и prompt injection

    Подключаем Vallum к coding-агенту и прогоняем воспроизводимый набор безопасных и вредоносных команд, включая фиктивные токены, prompt injection в выводе и запрещенное правило проекта.

  8. Проверяем AI Guardrails: утечки PII, prompt injection и опасные ответы

    Практический тест четырёх защитных механизмов WSO2: маскирования PII, обнаружения prompt injection, фильтрации контента и проверки галлюцинаций. Поведение шлюза сравнивается до и после включения каждой политики.

← Все разделы

Мы публикуем то, что работает у нас — и внедряем это же для вашего бизнеса. Обсудить задачу →