РАЗДЕЛ ЖУРНАЛА

Эксперименты

Материалы с проверяемыми источниками, практическими выводами и понятным уровнем сложности.

  1. Проверяем контур управления AI-агентом с помощью AgentGovBench

    Разворачиваем AgentGovBench, воспроизводим baseline без governance и изучаем, какие системные гарантии должен обеспечивать production-контур AI-агента.

  2. Langfuse, Phoenix или Opik: сравниваем три инструмента наблюдаемости AI-агента

    Подключаем одинаковый тестовый агент к трём open-source платформам и сравниваем их по заранее определённым критериям вместо пересказа каталога возможностей.

  3. Собираем регрессионные тесты для LLM-приложения

    Проходим полный цикл систематических evals: формулируем критерии, собираем датасет, добавляем unit-тесты и автоматическую оценку, затем проверяем регрессию двух версий промпта.

  4. LLM-судья под проверкой: прямые оценки против попарного сравнения

    На одном датасете сравниваем rubric-based scoring и pairwise evaluation, меняем порядок кандидатов и измеряем устойчивость выводов LLM-судьи.

← Все разделы

Мы публикуем то, что работает у нас — и внедряем это же для вашего бизнеса. Обсудить задачу →