Перейти к содержимому

Блог

Практические материалы об архитектуре LLM-приложений, маршрутизации моделей, оптимизации затрат и продакшен-эксплуатации AI-систем.

Свежие материалы

Маскирование PII перед вызовом модели: где и как делать
8 мин чтения
Маскирование PII перед вызовом модели: где и как делать
Маскирование PII помогает скрыть личные данные до запроса к LLM. Покажем, где ставить редактирование, как мерить потерю смысла и как безопасно вернуть поля.
маскирование PIIредактирование персональных данных
Когда останавливать AI-агента в финансах, медицине, праве
8 мин чтения
Когда останавливать AI-агента в финансах, медицине, праве
Когда останавливать AI-агента: разберем признаки риска в финансах, медицине и праве и покажем, где агент должен передать задачу человеку.
когда останавливать AI-агентапередача человеку
Что хранить для отладки промптов без риска для приватности
8 мин чтения
Что хранить для отладки промптов без риска для приватности
Что хранить для отладки промптов: разберем, как разделить сырые запросы, маскированные копии и метрики, чтобы не раскрывать личные данные.
что хранить для отладки промптовмаскирование данных в LLM
Поиск по базе знаний: эмбеддинги или генеративная модель
8 мин чтения
Поиск по базе знаний: эмбеддинги или генеративная модель
Поиск по базе знаний можно строить через эмбеддинги или через генеративную модель. Разберем индексацию, реранжирование и ответы с цитатами.
поиск по базе знанийэмбеддинги
Персонализация ассистента без лишнего профиля и риска
8 мин чтения
Персонализация ассистента без лишнего профиля и риска
Персонализация ассистента работает лучше, если хранить только признаки, которые меняют ответ: роль, язык, цель запроса и свежий контекст.
персонализация ассистентаминимизация данных
Бюджет на LLM для нескольких команд: как посчитать
8 мин чтения
Бюджет на LLM для нескольких команд: как посчитать
Покажем, как разложить бюджет на LLM по командам, лимитам и сценариям, чтобы расходы не выросли после пилота и перехода в продакшен.
бюджет на LLMрасходы на LLM
Прогноз расхода токенов: как заметить перерасход вовремя
8 мин чтения
Прогноз расхода токенов: как заметить перерасход вовремя
Прогноз расхода токенов помогает заранее увидеть перерасход, поставить пороги, поймать скачки по моделям и не ждать счёта в конце месяца.
прогноз расхода токенованомалии в расходе LLM
SLO для LLM-приложений: как считать по целям бизнеса
8 мин чтения
SLO для LLM-приложений: как считать по целям бизнеса
SLO для LLM-приложений помогают связать задержку, долю валидных ответов и цену с ожиданиями бизнеса, а не с графиками ради отчета.
SLO для LLM-приложенийзадержка и качество LLM
Суммаризация диалогов контакт-центра без лишнего шума
8 мин чтения
Суммаризация диалогов контакт-центра без лишнего шума
Суммаризация диалогов контакт-центра приносит пользу, если карточка звонка показывает тему, итог, риск и следующий шаг без лишних полей.
суммаризация диалогов контакт-центракарточка звонка для супервизора
Проверка фактов по источнику: как собрать набор тестов
8 мин чтения
Проверка фактов по источнику: как собрать набор тестов
Проверка фактов по источнику помогает собрать тесты, где ответ сверяют с документом, таблицей или БД. Разберем схему набора, частые ошибки и чек-лист.
проверка фактов по источникуавтоматический набор тестов
Оценка моделей на своих данных для задач продукта
8 мин чтения
Оценка моделей на своих данных для задач продукта
Оценка моделей на своих данных помогает выбрать LLM под задачи продукта: как собрать сценарии, эталоны, метрики и честно сравнить ответы.
оценка моделей на своих данныхсценарии пользовательских задач
Красная команда для корпоративного бота перед запуском
8 мин чтения
Красная команда для корпоративного бота перед запуском
Красная команда для корпоративного бота помогает найти утечки данных, обход инструкций и токсичные ответы до релиза и исправить их по шагам.
красная команда для корпоративного ботаатаки на утечки данных в LLM
Удаление данных у провайдера: что запросить до закупки
8 мин чтения
Удаление данных у провайдера: что запросить до закупки
Удаление данных у провайдера нельзя проверять на словах. До закупки запросите договорные пункты, логи, сроки очистки и порядок аудита.
удаление данных у провайдерапроверка хранения данных
Когда дообучение оправдывает затраты, а промпт уже нет
8 мин чтения
Когда дообучение оправдывает затраты, а промпт уже нет
Когда дообучение оправдывает затраты: разберём признаки потолка у промптов, типы задач, расчёт окупаемости и частые ошибки перед запуском.
когда дообучение оправдывает затратыкогда промпт упирается в потолок
Инъекции через вывод инструмента: как защитить агента
8 мин чтения
Инъекции через вывод инструмента: как защитить агента
Инъекции через вывод инструмента часто прячутся в CRM, письмах и HTML. Разберём, как фильтровать данные, изолировать инструменты и ставить проверки.
инъекции через вывод инструментазащита LLM-агента
Проверка кредитных и юридических документов с ИИ
8 мин чтения
Проверка кредитных и юридических документов с ИИ
Проверка кредитных и юридических документов с ИИ помогает быстрее находить рискованные места, но итоговый вывод по делу все равно делает специалист.
проверка кредитных и юридических документовИИ для проверки договоров
Разные токенизаторы у провайдеров: почему цифры не сходятся
8 мин чтения
Разные токенизаторы у провайдеров: почему цифры не сходятся
Разные токенизаторы у провайдеров меняют цену, лимиты и реальную длину контекста. Разберем, где расходятся расчеты и как это проверить заранее.
разные токенизаторы у провайдеровподсчет токенов LLM
Регрессии LLM: как заметить скрытый сдвиг до жалоб
8 мин чтения
Регрессии LLM: как заметить скрытый сдвиг до жалоб
Регрессии LLM не всегда видны сразу: разберем ежедневные прогоны, тревоги, контрольные кейсы и порядок проверки до жалоб пользователей.
Регрессии LLMконтрольные кейсы для LLM
Переключение между hosted и self-hosted моделью по расписанию
8 мин чтения
Переключение между hosted и self-hosted моделью по расписанию
Переключение между hosted и self-hosted моделью помогает снизить затраты и задержку, если разделить сценарии по времени суток, данным и пикам нагрузки.
переключение между hosted и self-hosted модельювнешний LLM API
Согласие пациента для LLM в клинике: что фиксировать
8 мин чтения
Согласие пациента для LLM в клинике: что фиксировать
Разбираем, как оформить согласие пациента для LLM в клинике: какие точки фиксировать до суммаризации, триажа и ответов по карте.
согласие пациента для LLM в клиникетриаж в клинике
Нормализация кодов ошибок LLM API для продукта и поддержки
8 мин чтения
Нормализация кодов ошибок LLM API для продукта и поддержки
Нормализация кодов ошибок LLM API помогает свести таймауты, лимиты и bad request в один словарь для продукта, логов и поддержки.
нормализация кодов ошибок LLM APIединый словарь ошибок
Цепочка моделей или одна сильная модель: где что лучше
8 мин чтения
Цепочка моделей или одна сильная модель: где что лучше
Разбираем, когда цепочка моделей или одна сильная модель дают лучший результат: сравним цену, задержку, качество и риск лишней сложности.
цепочка моделей или одна сильная модельпайплайн LLM
Два ответа на один запрос: когда выбор лучше одного
8 мин чтения
Два ответа на один запрос: когда выбор лучше одного
Разбираем, когда два ответа на один запрос помогают пользователю выбрать тон, формат или действие быстрее, а когда такой подход только путает.
два ответа на один запросальтернативы в ответах ИИ
Хранение состояния AI-агента: Redis, БД или журнал
8 мин чтения
Хранение состояния AI-агента: Redis, БД или журнал
Хранение состояния AI-агента влияет на паузы, одобрение и повторный запуск. Разбираем, когда выбрать Redis, БД или событийный журнал.
хранение состояния AI-агентаRedis для задач с паузами
Как не переплачивать за длинный контекст: что резать и что помнить
8 мин чтения
Как не переплачивать за длинный контекст: что резать и что помнить
Как не переплачивать за длинный контекст: разберем обрезку истории, сжатие и выбор памяти диалога, чтобы сохранить смысл и снизить токены.
как не переплачивать за длинный контекстсжатие контекста
Песочница для AI-инструментов: запись без лишних прав
8 мин чтения
Песочница для AI-инструментов: запись без лишних прав
Песочница для AI-инструментов помогает изолировать запись в CRM, БД и документы, чтобы агент менял только нужные поля и не получал лишний доступ.
песочница для AI-инструментовправа на запись для AI-агента
Скачок токенов: как найти причину до счёта после релиза
8 мин чтения
Скачок токенов: как найти причину до счёта после релиза
После релиза скачок токенов легко пропустить. Разберём, как проверить длину промпта, частоту вызовов, ретраи и странные сценарии до счёта.
скачок токеновдлина промпта
Окупаемость кэша запросов: формула и примеры расчета
8 мин чтения
Окупаемость кэша запросов: формула и примеры расчета
Окупаемость кэша запросов легко посчитать по простой формуле. Покажем порог повторов для поиска, поддержки и генерации писем.
окупаемость кэша запросовформула кэширования запросов
Что логировать в LLM-приложении без лишнего риска
8 мин чтения
Что логировать в LLM-приложении без лишнего риска
Разберём, что логировать в LLM-приложении, чтобы видеть сбои, ловить инциденты и проходить аудит без хранения промптов, PII и лишних данных.
что логировать в LLM-приложенииминимальный состав логов LLM
Когда реранкер окупается: recall, задержка и цена
8 мин чтения
Когда реранкер окупается: recall, задержка и цена
Разберём, когда реранкер окупается в поиске: как считать прирост recall, влияние на задержку, цену запроса и где лишний шаг не нужен.
когда реранкер окупаетсяреранкер в поиске
Маркировка AI-контента в интерфейсе: редактор, CRM, чат
8 мин чтения
Маркировка AI-контента в интерфейсе: редактор, CRM, чат
Показываем, как работает маркировка AI-контента в интерфейсе и где ставить метку в редакторе, CRM и чате, чтобы она помогала, а не мешала.
маркировка AI-контента в интерфейсеметка AI в редакторе
Политики доступа к моделям на один запрос без лишних рисков
8 мин чтения
Политики доступа к моделям на один запрос без лишних рисков
Политики доступа к моделям помогают задать правила по ролям, данным и средам, чтобы сдержать расходы и не выпускать чувствительные данные наружу.
политики доступа к моделямограничение дорогих моделей
Дедупликация повторных запросов в чатах и формах без вреда для UX
8 мин чтения
Дедупликация повторных запросов в чатах и формах без вреда для UX
Дедупликация повторных запросов помогает убрать двойные отправки из чатов и форм, сохранить UX и не терять данные при сбоях сети и очередей.
дедупликация повторных запросовдвойные отправки форм
Классификация жалоб клиентов: как сочетать правила и LLM
8 мин чтения
Классификация жалоб клиентов: как сочетать правила и LLM
Классификация жалоб клиентов помогает быстрее назначать очередь и SLA, если соединить простые правила, LLM, проверку уверенности и ручной разбор.
классификация жалоб клиентовмаршрутизация обращений
Нагрузочное тестирование LLM-сервиса: пик, очереди, узкие места
8 мин чтения
Нагрузочное тестирование LLM-сервиса: пик, очереди, узкие места
Нагрузочное тестирование LLM-сервиса помогает понять, где растут очереди, что ломает пик и как найти узкое место в API, сети и ретраях.
нагрузочное тестирование LLM-сервисаочереди в LLM API
Фичефлаги для AI-функций по арендаторам: схема запуска
8 мин чтения
Фичефлаги для AI-функций по арендаторам: схема запуска
Фичефлаги для AI-функций помогают включать новые модели по арендаторам без общего релиза: схема запуска, проверки, ошибки и пример.
Фичефлаги для AI-функцийзапуск моделей по арендаторам
Библиотека промптов для команды: карточки, теги, владельцы
8 мин чтения
Библиотека промптов для команды: карточки, теги, владельцы
Библиотека промптов помогает команде хранить рабочие шаблоны в одном месте: карточки, теги, владельцы, примеры и порядок обновления.
библиотека промптовкарточка промпта
Защита RAG от инъекций в промпт из документов на практике
8 мин чтения
Защита RAG от инъекций в промпт из документов на практике
Защита RAG от инъекций в промпт: как чистить документы, ограничивать инструменты, проверять источник и снижать риск ложных ответов.
защита RAG от инъекций в промптбезопасность RAG
Обогащение карточек товаров малыми моделями без лишних затрат
8 мин чтения
Обогащение карточек товаров малыми моделями без лишних затрат
Обогащение карточек товаров можно доверить малой локальной модели, если нужны атрибуты, теги и короткие описания без сложной генерации.
обогащение карточек товаровлокальная модель для атрибутов
Модель с открытыми весами: выбор для внутреннего контура
8 мин чтения
Модель с открытыми весами: выбор для внутреннего контура
Как выбрать внутреннюю LLM: модель с открытыми весами сравнивают по размеру, языкам, формату ответа и требованиям к GPU на типовых задачах.
модель с открытыми весамивнутренний контур LLM
Выбор типа модели для задачи на одном доменном наборе
8 мин чтения
Выбор типа модели для задачи на одном доменном наборе
Выбор типа модели для задачи проще, если прогнать один доменный набор через суммаризацию, извлечение, классификацию и чат и сравнить метрики.
выбор типа модели для задачисравнение суммаризации и извлечения
Модерация выходных ответов: где ставить фильтры и вторую модель
8 мин чтения
Модерация выходных ответов: где ставить фильтры и вторую модель
Модерация выходных ответов помогает не пропускать рискованный текст в чат, почту и CRM. Разберем, где ставить правила, фильтры и второй вызов.
модерация выходных ответовфильтры для LLM
Нормализация дат, валют и чисел после LLM без путаницы
8 мин чтения
Нормализация дат, валют и чисел после LLM без путаницы
Нормализация дат, валют и чисел помогает привести ответы LLM к одному виду: убрать разнобой в датах, суммах, разделителях и кодах валют.
нормализация дат, валют и чиселформатирование дат после LLM
Сессионный контекст и профиль пользователя: как разделить
8 мин чтения
Сессионный контекст и профиль пользователя: как разделить
Сессионный контекст и профиль пользователя нужно хранить отдельно: так ассистент не путает разовые детали, предпочтения, историю и личные данные.
сессионный контекст и профиль пользователяпамять ассистента
Зависимость от одного вендора: уход без рефакторинга
6 мин чтения
Зависимость от одного вендора: уход без рефакторинга
Разберем, как снизить зависимость от одного вендора через слой абстракции, тесты совместимости и пошаговую миграцию без крупного рефакторинга.
зависимость от одного вендораслой абстракции для LLM
Обрезка контекста LLM без потери смысла: окна и сводки
8 мин чтения
Обрезка контекста LLM без потери смысла: окна и сводки
Обрезка контекста LLM помогает держать диалог в рамках лимита токенов: разберем окна, приоритеты, сводки истории и быстрые проверки.
обрезка контекста LLMокно контекста
Размерность эмбеддингов: где ломается поиск и код
8 мин чтения
Размерность эмбеддингов: где ломается поиск и код
Размерность эмбеддингов влияет на поиск, индексы и схемы хранения. Показываем, где падает код, где проседает качество и как пройти миграцию.
размерность эмбеддинговвекторный поиск
Глоссарий для доменного поиска: часто полезнее модели
8 мин чтения
Глоссарий для доменного поиска: часто полезнее модели
Глоссарий для доменного поиска помогает системе понимать термины компании, синонимы и коды. Часто это даёт больше точности, чем смена модели.
глоссарий для доменного поискакорпоративный словарь терминов
Таймауты в LLM-цепочке: как разделить лимит времени
8 мин чтения
Таймауты в LLM-цепочке: как разделить лимит времени
Таймауты в LLM-цепочке влияют на ответ не меньше, чем выбор модели. Покажем, как делить общий SLA между шлюзом, поиском, инструментами и моделью.
таймауты в LLM-цепочкебюджет задержки LLM
Стоимость LLM в тенге: как собрать годовой бюджет
8 мин чтения
Стоимость LLM в тенге: как собрать годовой бюджет
Покажем, как посчитать стоимость LLM в тенге на год: токены, курсы валют, пики трафика, запас на тесты и понятный бюджет для команды.
стоимость LLM в тенгегодовой бюджет LLM
Хеджированные запросы к двум моделям: когда падает p95
8 мин чтения
Хеджированные запросы к двум моделям: когда падает p95
Хеджированные запросы к двум моделям помогают убрать редкие долгие ответы, но иногда лишь удваивают расходы. Разберём пороги, метрики и ошибки.
хеджированные запросы к двум моделямснижение p95
Черновик и действие в AI-процессе: как ставить барьер
8 мин чтения
Черновик и действие в AI-процессе: как ставить барьер
Черновик и действие в AI-процессе помогают не давать модели сразу менять статус заявки, лимит или запись. Разберём правило, шаги и проверки.
черновик и действие в AI-процессеразделение черновика и действия
Отказ внешнего LLM-провайдера: план действий на день
7 мин чтения
Отказ внешнего LLM-провайдера: план действий на день
Отказ внешнего LLM-провайдера: пошаговый план на день сбоя - как переключить роутинг, ввести лимиты, упростить функции и собрать команды.
отказ внешнего LLM-провайдерароутинг моделей
Кто имеет право менять промпты в продакшене: схема
7 мин чтения
Кто имеет право менять промпты в продакшене: схема
Кто имеет право менять промпты в продакшене: разберём роли, ревью, журнал изменений и откат, чтобы команда не решала всё личными договорённостями.
кто имеет право менять промпты в продакшенероли для промптов
Судья-модель для автооценки: где верить, а где проверять
8 мин чтения
Судья-модель для автооценки: где верить, а где проверять
Судья-модель для автооценки помогает быстро проверять ответы, но не везде. Разберём рубрику, ручную выборку и признаки системных ошибок.
судья-модель для автооценкирубрика оценки LLM
Пайплайн оценки перед релизом: от набора до регрессий
8 мин чтения
Пайплайн оценки перед релизом: от набора до регрессий
Пайплайн оценки перед релизом помогает поймать регрессии до выката: как собрать золотой набор, выбрать метрики и сделать отчёт, который читают за 10 минут.
пайплайн оценки перед релизомзолотой набор для LLM