Как ускорить ИИ-агента с RAG в проде и не слить бюджет: кэшируем ответы на примере ИИ-консультанта
Как ускорить ИИ-агента с RAG в проде и не слить бюджет: кэшируем ответы на примере ИИ-консультанта
Заметил, и вы наверное тоже, что сейчас почти каждый домен и почти каждый продукт развивает своего ИИ-агента. Яндекс Маркет запустил Маркет AI, который подбирает товары, у Авто.ру есть Авто.ру AI, в Лавке появился ассистент, вот у одного только Яндекса их сколько. А кто-то уже начал перестраивать CJM вокруг агента: пользователь не ходит по фильтрам и каталогу, а просто пишет, что ему нужно. Назвать это полным переходом на агентские интерфейсы или на агентский поиск, конечно, пока нельзя. Но первые шаги уже есть. Я и сам, собственно, «владелец» нескольких таких агентов в е-коме. Статья будет полезна инженерам, продактам и всем неравнодушным, кто хочет разбираться в теме чуть глубже, чем просто обычный пользователь. А поговорим мы сегодня о том, с какими проблемами такие агенты живут в продакшене, на что жалуются пользователи и как бороться с главной болячкой – скоростью. С какими проблемами такие агенты сталкиваются в проде Про каждую можно писать отдельную статью, поэтому коротко: — Скорость (латенси). Каждый поход за данными добавляет время: поиск по базе, обход графа, вызов инструмента. А после каждого шага модель заново читает всю переписку и конечно заявленные 20-30 секунды редко получается держать. — Пустые и неверные ответы. Модель может передать в поиск мусор и ничего не найти или найти не то. — Устаревшие данные. Цены, наличие и статусы заказов меняются постоянно, а…