Агентская разработка без вайб-кодинга: как Avito удерживает качество, когда агенты пишут код за секунды
Если агент генерирует код за секунды, это не значит, что он генерирует его правильно. Андрей Бровко, руководитель тестирования Avito Авто, разбирает на Habr ключевое разграничение, которое в индустрии пока плохо усвоено: скорость генерации и качество результата не одно и то же, без процессов первая просто быстрее доставляет дефекты.
Вайб-кодинг против агентской инженерии
Термин “вайб-кодинг” ввёл Андрей Карпаты: так называют режим, когда код генерируется без контроля внутренней логики. Он же предложил альтернативу “агентскую инженерию” (agent engineering), предсказуемый и масштабируемый подход в рамках методологии. Разница не в инструменте, а в наличии или отсутствии процессов вокруг него.
Контекст важен. По бенчмарку SWE-bench (набор реальных GitHub-задач) языковые модели в 2023 году решали около 2% задач, с 2025 года — более 70%, в 2026-м — уже более 80%.
Пилот Avito: что показали метрики
В 2025 году Avito запустил внутренний пилот: 100 инженеров получили доступ к топовым моделям. По объективным метрикам эффективности и качества статистически значимых изменений не зафиксировано. Субъективно инженеры отмечали ускорение.
Бровко трактует отсутствие просадки как позитивный сигнал: при внедрении новых технологий метрики обычно проседают, это J-кривая обучения. То, что показатели качества не ухудшились, он расценивает как признак нормального прохождения этого этапа.
Платформа: три сервиса как контурная защита
В 2026 году Avito централизовало управление агентской инфраструктурой через три сервиса.
skills-hub, магазин навыков с контролем качества и безопасности. Навыки проходят статическое и динамическое тестирование (evals в CI), ревью экспертом домена, живое тестирование на реальных задачах. Каждый навык версионируется и должен быть самодостаточным.
mcp-hub, MCP-сервер для доступа к внутренней инфраструктуре: кодовой базе, документации, баг-трекингу. При проектировании MCP-серверов применяется паттерн Tolerant Reader, используются стандартные имена параметров, минимизируется число инструментов и вызовов, оптимизируется передаваемый контекст. Тестирование рекомендуется проводить на моделях среднего уровня, а не только на топовых: они чаще ошибаются и лучше выявляют слабые места.
AVIDA, среда для автономного запуска агентов на удалённом сервере по расписанию или по запросу.
Отдельно зафиксировано требование к модели: большое контекстное окно обязательно. Локальные модели типа Qwen 32B с 32k токенами признаны непригодными для агентской разработки: эксперимент показал, что модель плохо следует инструкциям.
Spec-Driven Development: тесты до кода, спецификация как ограничитель

Бровко описывает подход разработки от спецификации, предполагающий два уровня ограничения модели.
Первый, спецификация: пользовательские истории и критерии приёмки в md-формате. Второй, тесты: они генерируются до кода и проходят ревью человека. Каждый критерий приёмки привязан к конкретному юнит-тесту, что даёт полное покрытие требований. Human-in-the-loop обязателен: человек проверяет спецификацию, дизайн и тесты до генерации кода.
Из готовых инструментов реализации упомянуты SpecKit, Superpowers и OpenSpec, все с открытым исходным кодом.
Как это соотносится с дизайном самих агентов
Бровко рассматривает проблему со стороны QA: как удержать качество, когда агент уже работает. Другие заметки в этой базе разбирают смежные вопросы со стороны дизайна агента: где агент может незаметно сойти с рельсов (тихие отказы) и в каких точках решение стоит передавать человеку (контрольные точки с участием человека). Бровко добавляет к этим вопросам QA-перспективу: что именно проверять и по каким метрикам понять, что процесс идёт нормально. Обе стороны, дизайн и контроль качества, рассматривают разные аспекты одной задачи.