РАЗДЕЛ ЖУРНАЛА

Инструменты

Материалы с проверяемыми источниками, практическими выводами и понятным уровнем сложности.

  1. Как ограничить ущерб от ошибки AI-агента: практический тест полномочий

    Практическая реализация проверки blast radius: моделируем ошибочные решения агента для чтения, записи, отправки сообщений и финансовых операций, затем измеряем, какие защитные механизмы предотвращают необратимые последствия.

  2. AI-патч как проверка стоимости задачи до начала разработки

    Эксперимент на нескольких небольших задачах: агент создаёт ограниченный пробный патч, после чего команда оценивает затронутые компоненты, тесты и продуктовые риски. Результаты сравниваются с предварительными экспертными оценками.

  3. Как проверить скрытые напоминания и расход контекста в логах Claude Code

    Источник предлагает конкретный проверяемый эксперимент с JSONL-логами: найти служебный тег, отличить число строк от числа вхождений и отдельно посчитать токены по полям usage. Утверждения о стоимости и доле самого напоминания потребуют независимой проверки.

  4. Как проверить LLM на атаки без LLM-судьи

    Практический тест Crashkit и gradecore: сравниваем повторяемость regex, exact-match и canary-проверок, ищем передачу API-ключа через Network и фиксируем ограничения браузерного BYOK.

  5. Единая консоль для coding-агентов: тестируем BossConsole

    Установка BossConsole и воспроизводимый тест агентной задачи, включающей поиск в браузере, изменение проекта и проверку Git diff. Отдельно оцениваются управление инструментами, секретами и границами доступа.

  6. Запускаем агентную систему на Go с Seshat

    Реализуем небольшой сценарий на открытом Go-рантайме Seshat и оцениваем на конкретном примере удобство единого бинарника, MCP-интеграции и смены LLM-провайдера.

  7. MCP-сервер с нуля: инструмент, тестирование и подключение к агенту

    Пошаговая реализация MCP-инструмента поверх FastAPI-сервиса с проверкой схемы, журналированием вызовов и тестом совместимости с агентом.

  8. Безопасная первая настройка Claude Code в VS Code

    Практический сценарий для сравнения поведения расширения и автономного CLI: установка в изолированной директории, проверки claude --version и claude doctor, тест PATH и журнал разрешений. Рекламные утверждения о стороннем API следует исключить, а технические требования сверить с документацией Anthropic.

  9. Интерактивная сортировка GitHub Issues с помощью Copilot Canvas

    Создание интерфейса через /create-canvas и проверка на реальном репозитории. В тесте сравниваются canvas и стандартный список GitHub по времени обработки, числу действий и ошибочным решениям.

  10. GitHub Copilot или прямой API: считаем реальную стоимость одной задачи

    Выполняем одинаковую задачу из issue до протестированного изменения через Copilot и собственный API-harness, фиксируя контекст, повторы, токены и необходимую инфраструктуру.

  11. CowAgent как персональный агент: тест памяти, инструментов и моделей

    Развернем CowAgent в изолированной среде и прогоним одинаковый набор задач на нескольких моделях, измеряя успешность действий, стоимость, задержку и восстановление фактов между сессиями.

  12. CyberStrike против обычного сканера: тест на уязвимом веб-приложении

    Разворачиваем намеренно уязвимое приложение в изолированной среде и запускаем CyberStrike только в разрешенном контуре. Сравниваем результаты с обычным DAST-сканером и вручную воспроизводим каждую находку.

  13. Контроль AI-агентов в deco Studio: инструменты, права и стоимость

    Запускаем deco Studio, создаём агента с ограниченным набором инструментов и проверяем три сценария: разрешённый вызов, запрещённое действие и трассировку затрат. Отдельно оцениваем пригодность платформы для командного использования.

  14. Трёхдневная задержка Dependabot: проверяем защиту от опасных релизов

    Создадим тестовый репозиторий, настроим разные интервалы cooldown и проследим, какие обычные и security-обновления задерживаются, а затем сформулируем конфигурацию для AI-проекта.

  15. Diff-first code review: как сократить стоимость проверки AI-агентом

    Реализация и сравнение двух стратегий: широкого исследования репозитория и проверки от diff к минимально необходимым доказательствам. Измеряются полезные замечания, токены, стоимость, число поисков и объём прочитанного кода.

  16. Как формат графа влияет на стоимость и точность GraphRAG

    Сравнить JSON, списки рёбер, таблицы и ISONGraph на одинаковом графе и наборе вопросов. Заявленные преимущества ISONGraph следует проверить самостоятельно по опубликованной методике и репозиторию.

  17. Составляем и проверяем бюджет контекстного окна LLM: контекстное окно llm

    Инструментируем реальный запрос, считаем вклад системной инструкции, истории, RAG-фрагментов и схем инструментов, после чего сравниваем полный и сокращенный контекст по цене, задержке и качеству.

  18. Function calling у разных LLM: сравниваем схемы и выбор инструментов

    Практическое сравнение нативного function calling у OpenAI и Anthropic с унифицированным интерфейсом LangChain на одном наборе задач и метрик.

  19. Как подобрать температуру LLM с помощью повторяемого eval-теста: llm evaluation

    Проводим несколько прогонов одного набора запросов при разных температурах, сравниваем корректность, соблюдение формата и вариативность, а затем фиксируем параметры для продакшена.

  20. LobsterAI на практике: тест локального агента для документов, таблиц и браузера

    Устанавливаем LobsterAI, запускаем обработку таблицы, создание презентации и браузерную проверку, затем оцениваем артефакты, запросы разрешений и устойчивость выполнения.

  21. MCP на практике: подключаем файлы и браузер к AI-ассистенту

    Пошаговая установка MCP-серверов и эксперимент, сравнивающий выполнение одинаковых заданий обычным чат-ассистентом и ассистентом с доступом к инструментам.

  22. Подключаем AI-агента к базе данных через MCP Toolbox

    Разворачиваем MCP Toolbox, описываем инструменты в tools.yaml, подключаем MCP-клиент и проверяем корректные запросы, валидацию параметров и запрет операций вне заданного набора.

  23. Какую нейросеть потянет ваш компьютер: выбираем модель Ollama для 8, 16 и 32 ГБ памяти

    Пошаговый эксперимент с Ollama: запуск модели, проверка распределения между GPU и CPU, сравнение квантизаций и контекстных окон, а также выбор конфигурации по результатам замеров.

  24. Локальный агент на Ollama и MCP: сборка и проверка вызова инструментов

    Практическая сборка связки Ollama и MCP с воспроизводимым сценарием: подключить безопасный тестовый инструмент, измерить успешность и задержку вызовов и сравнить несколько локальных моделей.

  25. OpenLoomi на практике: проверяем локального агента внимания

    Подключим тестовый набор рабочих данных, зададим контрольные события и проверим полноту напоминаний, точность ссылок на источники, локальное хранение и количество ложных срабатываний.

  26. Проверяем POCKET-35B без GPU: скорость, память и качество

    Воспроизводимая проверка опубликованных разработчиком результатов в stock llama.cpp. Материал позволяет сопоставить две квантизованные модели на одинаковых промптах и отделить измеряемые преимущества от рекламных утверждений.

  27. Как выбрать поиск для RAG: SQL, BM25, векторы или гибрид

    Соберем небольшой контрольный набор вопросов и сравним SQL-фильтрацию, полнотекстовый поиск, векторный поиск и гибридную схему с переранжированием. Отдельно проверим точные названия, смысловые запросы, ограничения доступа и устаревшие документы.

  28. Автооптимизация промптов по production-трассам: считаем качество и окупаемость

    Источник разбирает реализованный на Go шлюз route-switch, его хранилища SQLite и DuckDB, стратегии оценки и ограничения оптимизации. Статья может воспроизвести цикл на задаче с проверяемыми ответами, сопоставить exact match, keyword match и similarity, а также проверить заявленные функции по коду.

← Все разделы

Мы публикуем то, что работает у нас — и внедряем это же для вашего бизнеса. Обсудить задачу →