РАЗДЕЛ ЖУРНАЛА
Эксперименты
Материалы с проверяемыми источниками, практическими выводами и понятным уровнем сложности.
- Проверяем контур управления AI-агентом с помощью AgentGovBench
Разворачиваем AgentGovBench, воспроизводим baseline без governance и изучаем, какие системные гарантии должен обеспечивать production-контур AI-агента.
- Langfuse, Phoenix или Opik: сравниваем три инструмента наблюдаемости AI-агента
Подключаем одинаковый тестовый агент к трём open-source платформам и сравниваем их по заранее определённым критериям вместо пересказа каталога возможностей.
- Собираем регрессионные тесты для LLM-приложения
Проходим полный цикл систематических evals: формулируем критерии, собираем датасет, добавляем unit-тесты и автоматическую оценку, затем проверяем регрессию двух версий промпта.
- LLM-судья под проверкой: прямые оценки против попарного сравнения
На одном датасете сравниваем rubric-based scoring и pairwise evaluation, меняем порядок кандидатов и измеряем устойчивость выводов LLM-судьи.