Писать код становится всё дешевле, а вот понять, что бизнес-результат действительно достигнут, для агента всё ещё нетривиальная задача.
Тестами можно проверить, что код работает, но кто-то всё ещё должен открыть продукт, пройти реальный сценарий, посмотреть мобильную версию и сказать:
— Не, вот тут не то пальто.
Мы в команде видим это чуть ли не каждый день: агенты пропускают баги, не замечают очевидных ляпов и иногда уверенно сдают то, что человек отбраковывает с первого взгляда. Даже фронтирные модели.
Мы привыкли думать, что человек вызывает ИИ по необходимости. Что, если ИИ будет обращаться к человеку, что бы пройти валидацию?
Например, агент сам собрал приложение, прогнал тесты, через API заказал ручного тестировщика на полчасика, получил замечания, всё исправил и отправил результат заказчику на проверку.
Human-in-the-loop как сервис.