Skip to content
Назад к услугам

Разработка ИИ-решений

Прикладные ИИ-системы на реальной инфраструктуре: локальный и облачный inference LLM, retrieval и структурированные знания. Не прототипы на одних промптах, разваливающиеся за пределами демо.

Начать проект

Обзор

Я строю прикладные ИИ-системы, которые выходят за рамки одного промпта. Это инфраструктура retrieval, памяти и inference, рассчитанная на реальную нагрузку, а не на то, чтобы хорошо смотреться в демо.

Как я это строю

Локальный inference LLM вступает в игру, когда стоимость, задержка или контроль над данными исключают использование только облачного API. Часто для этого подходят открытые модели вроде Qwen2.5 через Ollama. В части retrieval я сочетаю векторный поиск сходства со структурированными графовыми знаниями — там, где связи важны не меньше, чем сходство.

Слой inference, слой знаний/памяти и слой приложения остаются чётко разделёнными, чтобы каждый мог развиваться по своему графику. А продакшен-требования появляются с первого дня, а не после запуска: контейнеризированное развёртывание, наблюдаемость, оценка на известных сценариях до того, как система начнёт работать без надзора.

Кому это подходит

Командам, которым нужна ИИ-функциональность, встроенная в реальный продукт или процесс, а не proof-of-concept, тихо умирающий при первом же контакте с продакшн-данными.

FAQ

Вы работаете только с облачными API вроде OpenAI/Anthropic?

Нет. Я также строю решения на локально размещённых открытых моделях через Ollama, когда этого требуют стоимость, задержка или требования к резидентности данных.

Чем это отличается от консалтинга по промпт-инженерии?

Фокус лежит на архитектуре системы: память, retrieval, оркестрация. Формулировка промптов — небольшая часть этой работы, а не вся работа.