Разработка ИИ-решений
Прикладные ИИ-системы на реальной инфраструктуре: локальный и облачный inference LLM, retrieval и структурированные знания. Не прототипы на одних промптах, разваливающиеся за пределами демо.
Начать проектОбзор
Я строю прикладные ИИ-системы, которые выходят за рамки одного промпта. Это инфраструктура retrieval, памяти и inference, рассчитанная на реальную нагрузку, а не на то, чтобы хорошо смотреться в демо.
Как я это строю
Локальный inference LLM вступает в игру, когда стоимость, задержка или контроль над данными исключают использование только облачного API. Часто для этого подходят открытые модели вроде Qwen2.5 через Ollama. В части retrieval я сочетаю векторный поиск сходства со структурированными графовыми знаниями — там, где связи важны не меньше, чем сходство.
Слой inference, слой знаний/памяти и слой приложения остаются чётко разделёнными, чтобы каждый мог развиваться по своему графику. А продакшен-требования появляются с первого дня, а не после запуска: контейнеризированное развёртывание, наблюдаемость, оценка на известных сценариях до того, как система начнёт работать без надзора.
Кому это подходит
Командам, которым нужна ИИ-функциональность, встроенная в реальный продукт или процесс, а не proof-of-concept, тихо умирающий при первом же контакте с продакшн-данными.
FAQ
Вы работаете только с облачными API вроде OpenAI/Anthropic?
Нет. Я также строю решения на локально размещённых открытых моделях через Ollama, когда этого требуют стоимость, задержка или требования к резидентности данных.
Чем это отличается от консалтинга по промпт-инженерии?
Фокус лежит на архитектуре системы: память, retrieval, оркестрация. Формулировка промптов — небольшая часть этой работы, а не вся работа.