AlpinaGPT: код-ревью с 2 суток до 15 минут через мультиагентную систему (без автономных агентов в проде)
Когда команда WebRegul за год выросла втрое, код-ревью превратился в узкое горло: ожидание ревью растянулось до двух суток, а суммарные потери по одной команде достигли около 100 часов в месяц — две с половиной недели работы одного опытного разработчика. Ревьюеры из других команд либо долго погружались в контекст, либо проверяли код формально. CTO WebRegul и AlpinaGPT Сергей Андриянов принял решение автоматизировать процесс — и получил продукт Evolver, который вырос из внутренней боли.
Три попытки до рабочей архитектуры
Первая версия — один большой агент-универсал, собранный за две недели на Claude Code — провалилась: один агент-универсал плохо масштабируется по мере роста числа задач.
Вторая версия с детерминированным флоу оказалась достаточно убедительной, чтобы получить грант Фонда содействия инновациям. Третья, продакшн-версия, по словам Андриянова, работает в три прохода: сначала код разбирается в структуру (с формированием RAG и документации для агентов), затем следует семантическое понимание по смыслу без знания имён функций, наконец строится граф зависимостей — кто кого вызывает.
Четыре специализированных агента
Вместо универсала — разделение обязанностей.
Библиотекарь читает задачи из YouTrack и Jira, техническое задание, комментарии команды.
Исследователь знает кодовую базу, граф вызовов и зависимостей.
Ревьюер пишет замечания, привязывает их к конкретным строкам и фиксирует результаты в Git и трекере.
Консультант — четвёртый агент, ориентированный не на ревью, а на помощь аналитикам, тестировщикам и новичкам: отвечает на вопросы об архитектуре и кодовой базе на естественном языке, снимая нагрузку с сеньоров.
В итоге ожидание сократилось с двух суток до нескольких часов, а на рутинных мёрж-реквестах — до 15 минут, и команда высвободила около 100 часов работы в месяц.
Почему 70% — детерминированный флоу, а не агенты
Ключевое архитектурное решение Evolver: 70% workflow, 30% автономных агентов. Автономные агенты непредсказуемы по времени и стоимости, чаще ошибаются и плохо отлаживаются. Команда опирается на позицию Anthropic из материала «Building Effective Agents»: для хорошо определённых задач с высокой ценой ошибки детерминированный флоу предпочтительнее автономии.
Что сознательно оставили за человеком: архитектурные решения и написание кода. Последнее — принципиальный отказ. Аргумент — «доверие хрупкое»: один неудачный совет агента ведёт к потере доверия к системе в целом. Это согласуется с данными DORA Report 2024: 39% разработчиков не доверяют коду, сгенерированному ИИ, а рост внедрения ИИ-инструментов сопровождается снижением стабильности поставки ~на 7%.
Два месяца до принятия командой
Методология внедрения строится в два этапа. Первые две недели агент работает в фоне, без каких-либо обязательств со стороны разработчиков — просто показывает, что умеет. Следующие 2–3 недели — обязательное использование с еженедельным разбором ошибок агента. За этот период точность ревью выросла с 70% до 90%. Часть разработчиков, которые изначально сопротивлялись, сами стали просить подключить агента к другим проектам.
Полный путь от проблемы до продукта — около 1,5–2 месяцев. Для руководителя или PMO этот кейс показывает конкретную точку выбора: там, где узкое горло образовано повторяемой, хорошо определённой задачей, мультиагентная автоматизация с HITL на критических точках даёт измеримый результат; полная автономия — нет.