Писать код становится всё дешевле, а вот понять, что бизнес-результат действительно достигнут, для агента всё ещё нетривиальная задача.

Тестами можно проверить, что код работает, но кто-то всё ещё должен открыть продукт, пройти реальный сценарий, посмотреть мобильную версию и сказать:

— Не, вот тут не то пальто.

Мы в команде видим это чуть ли не каждый день: агенты пропускают баги, не замечают очевидных ляпов и иногда уверенно сдают то, что человек отбраковывает с первого взгляда. Даже фронтирные модели.

Мы привыкли думать, что человек вызывает ИИ по необходимости. Что, если ИИ будет обращаться к человеку, что бы пройти валидацию?

Например, агент сам собрал приложение, прогнал тесты, через API заказал ручного тестировщика на полчасика, получил замечания, всё исправил и отправил результат заказчику на проверку.

Human-in-the-loop как сервис.