ИИ-Химик против ChatGPT: почему вопрос доверия к косметическим формулам становится критическим

За последние два года запросы вида «расшифруй состав крема по INCI» или «безопасен ли этот консервант» стали одними из самых частых обращений к языковым моделям в косметической тематике. Формулятор, дерматокосметолог, блогер-ревьюер или просто покупатель с телефоном у полки магазина — все они всё чаще открывают ChatGPT вместо того, чтобы искать данные в справочниках по сырью или обращаться к химику-технологу. Проблема в том, что универсальная языковая модель отвечает на вопрос об INCI-составе так же, как отвечает на вопрос про историю или литературу — генерируя наиболее вероятный текст, а не проверенный факт.
Это принципиальное различие определяет тезис данной статьи: обычный ChatGPT без внешней базы данных склонен галлюцинировать при интерпретации косметических формул, а архитектура RAG (Retrieval-Augmented Generation), построенная на верифицированной базе INCI, CIR-отчётов и данных поставщиков сырья, устраняет большую часть этих ошибок за счёт того, что модель не изобретает ответ, а извлекает его из проверенного источника перед генерацией текста.
Почему тема стала критической именно сейчас
Рост интереса к «ИИ-разбору составов» совпал с тремя параллельными тенденциями:
- Массовый переход потребителей к самостоятельной проверке косметики через приложения и чат-боты вместо консультации с косметологом или химиком.
- Появление регуляторных ограничений (обновления EU CosIng, пересмотр списка аллергенов в 2023 году), которые быстро устаревают в «памяти» языковых моделей, обученных на статичном корпусе данных.
- Использование ИИ-инструментов не только конечными потребителями, но и начинающими формуляторами — то есть ошибка в интерпретации INCI переходит из категории «неточный совет» в категорию «риск для реальной формулы, идущей в производство».
Именно третий пункт делает вопрос доверия критическим. Ошибка ChatGPT в ответе на вопрос «сколько это стоит» — раздражает. Ошибка ChatGPT в ответе «можно ли сочетать Ascorbic Acid и Niacinamide в одной фазе при pH 5» или «является ли Phenoxyethanol безопасным в концентрации 1,2%» — способна привести к нестабильной эмульсии, раздражающей коже готовой продукции или к регуляторному нарушению при выводе продукта на рынок.
Где именно возникает разрыв между «звучит убедительно» и «верно»
Языковые модели общего назначения обучены предсказывать следующий токен на основе статистических закономерностей в тексте, а не на основе актуальной химической базы данных. Для косметической химии это создаёт специфический риск: модель может уверенно назвать несуществующий максимальный процент ввода ингредиента, спутать функцию INCI-компонента (например, приписать эмолентные свойства сырью, которое в базе CosIng зарегистрировано как ПАВ), или «дособрать» правдоподобно звучащий, но фактически неверный механизм действия — то, что в литературе по надёжности LLM называется confabulation, а не классической галлюцинацией в строгом смысле (согласно разграничению по Ji et al., 2023).
Дальнейшие секции статьи разберут это различие детально: как устроена RAG-архитектура ИИ-Химика, на каких базах она обучена, какие конкретные типы ошибок демонстрирует обычный ChatGPT при разборе реальных формул, и почему возврат к первоисточнику — а не к «памяти» модели — становится новым стандартом доверия в косметической химии. Отдельное внимание будет уделено практическим кейсам, где разница между генерацией «из головы» и извлечением из верифицированной базы данных имеет прямые последствия для стабильности рецептуры и безопасности потребителя.
Что такое галлюцинации языковых моделей и почему INCI-анализ — идеальная среда для их появления

Термин «галлюцинация» в контексте языковых моделей описывает не сбой программы, а закономерный побочный эффект того, как эти модели устроены. Модель типа GPT генерирует текст токен за токеном, выбирая каждое следующее слово по вероятностному распределению, вычисленному на основе предыдущего контекста и весов, «зашитых» в нейросеть при обучении. Никакого обращения к внешней базе данных, никакой проверки факта «существует ли такой ингредиент» в этом процессе не происходит — модель просто продолжает текст так, как это статистически вероятно, судя по миллиардам примеров, которые она видела при обучении (по данным Ji et al., 2023).
Это значит, что для LLM название вещества Sodium Hyaluronate и гипотетическое Sodium Hyalurofermentate Complex с точки зрения генерации токенов почти неотличимы — оба звучат «правдоподобно» как химическое название, оба вписываются в грамматический и стилистический паттерн INCI-номенклатуры. Модель не «знает», что второго вещества не существует в реестре CosIng или INCI Dictionary — она просто продолжает последовательность токенов, которая максимизирует вероятность правдоподобного продолжения.
Параметрическая память vs факт

Ключевая причина галлюцинаций — отсутствие grounding, то есть привязки генерации к верифицируемому внешнему источнику. Знания LLM хранятся не как таблица «ингредиент → CAS-номер → допустимая концентрация», а как распределённые веса в миллиардах параметров нейросети — так называемая параметрическая память. Это принципиально иной способ хранения информации, чем реляционная база данных:
- В базе данных факт «Sodium Ascorbyl Phosphate стабилен при pH 6–7» либо есть как запись, либо запрос вернёт пустой результат.
- В параметрической памяти LLM тот же факт растворён в весах, которые статистически усиливают одни продолжения текста и ослабляют другие — но не гарантируют, что модель воспроизведёт именно правильное число, а не близкое по «звучанию» неправильное.
Именно поэтому языковая модель может уверенно назвать неверный процент — например, заявить, что Retinol безопасен в безрецептурной косметике в концентрации 3%, хотя регуляторные лимиты в большинстве юрисдикций значительно ниже. Число «3%» никак не связано с фактической регуляторной нормой — оно просто статистически похоже на числа, которые модель видела рядом со словом «ретинол» в обучающих текстах, включая форумы, маркетинговые описания и непроверенные блоги.
Почему INCI-анализ — почти идеальный триггер для галлюцинаций
Косметическая химия сочетает несколько факторов, которые вместе создают исключительно благоприятную среду для генерации ложной, но правдоподобной информации:
- Псевдо-латинская номенклатура. INCI-названия построены по предсказуемым морфологическим паттернам (Sodium ...ate, ...yl Glucoside, Hydrolyzed ...). Модель легко генерирует новые комбинации, которые выглядят валидно, но не существуют в реестре.
- Числовая точность там, где нужна достоверность, а не вероятность. Концентрации активных веществ, значения pH, температуры фазового перехода — это точечные факты, а не паттерны языка. LLM хорошо предсказывает «какое число обычно стоит рядом с этим словом», но не «какое число верно с точки зрения регуляторной нормы или химической стабильности».
- Разреженность и противоречивость обучающих данных. В открытом интернете формулы косметики описаны неполно, часто с ошибками маркетингового происхождения, а данные CIR, SCCS и научных публикаций представлены в объёме, несопоставимом с массивом маркетинговых текстов. Модель усваивает шум почти в той же пропорции, что и факты (по Marcus & Davis, 2020).
- Отсутствие негативных примеров. Модель практически никогда не видит эксплицитного текста вида «Ингредиента X не существует» — она обучена на утверждающих, а не отрицающих корпусах, что делает её структурно предрасположенной подтверждать, а не отрицать существование сущности (по Bang et al., 2023).
Исследование Lin et al. (2022) прямо показывает, что уверенность формулировки ответа LLM никак не коррелирует с его фактической точностью — модель «звучит» одинаково убедительно, говоря правду и придумывая несуществующий CAS-номер. Для косметической рецептуры, где ошибка в 1% концентрации активного ингредиента или спутанный CAS-номер может привести к нестабильной эмульсии или регуляторному нарушению, это свойство делает голый LLM без внешней верификации инструментом повышенного риска — и именно этот разрыв закрывает архитектура RAG, о которой пойдёт речь дальше.
Архитектура RAG: как retrieval-augmented generation меняет правила игры
Обычный ChatGPT отвечает на вопрос о совместимости Retinol и Ascorbic Acid, опираясь только на веса нейросети, зафиксированные в момент обучения. Никакого обращения к первоисточникам не происходит — модель генерирует наиболее вероятную последовательность токенов, статистически похожую на то, что она видела в текстах. Retrieval-augmented generation (RAG) меняет саму механику ответа: перед генерацией система физически достаёт релевантные фрагменты из верифицированной базы данных и подставляет их в промпт как обязательный контекст. Модель больше не «вспоминает» — она читает и пересказывает.
Эмбеддинги: как текст превращается в вектор смысла
Первый шаг архитектуры — векторизация. Каждая единица знания в базе (карточка INCI-ингредиента, исследование по стабильности, параграф из регуляторного документа CosIng или CIR) прогоняется через embedding-модель, которая превращает текст в числовой вектор размерностью от 384 до 1536 координат. Смысл этой операции простой: тексты с близким значением получают близкие в пространстве векторы. Запрос пользователя «можно ли смешивать ниацинамид с витамином C» и карточка ингредиента Niacinamide, где описана кинетика реакции с Ascorbic Acid при pH ниже 4, окажутся геометрически близко друг к другу — даже если ни одного общего слова в них нет.
Именно здесь пролегает первое принципиальное отличие от чистой генерации: поиск ведётся не по ключевым словам, а по смысловой близости, что критично для косметической химии — синонимия INCI-названий (Tocopherol vs «витамин E», Sodium Ascorbyl Phosphate vs «SAP») в лексическом поиске потерялась бы, а в векторном пространстве сохраняется.
Векторный поиск и ре-ранкинг: два фильтра вместо одного
Запрос пользователя тоже превращается в вектор, и система ищет k наиболее близких фрагментов в векторной базе (обычно используются индексы типа HNSW или IVF-PQ для быстрого приближённого поиска среди миллионов записей). На этом этапе извлекается «широкий невод» — 50-100 потенциально релевантных чанков.
Дальше вступает второй фильтр — ре-ранкинг (re-ranking). Отдельная, более точная (и более медленная) модель — кросс-энкодер — пропускает пары «запрос + каждый найденный фрагмент» через более глубокий анализ совместного контекста и присваивает точный скор релевантности. Из 50-100 кандидатов остаются 3-8 самых точных фрагментов. Ре-ранкинг нужен потому, что первичный векторный поиск оптимизирован на скорость, а не на точность: он может поднять фрагмент про «фотостабильность ретинола» на запрос про «фотостабильность ретинальдегида» — похожие термины, разная химия. Ре-ранкер отсекает такие ложные срабатывания.
| Этап | Задача | Типичная скорость |
|---|---|---|
| Эмбеддинг запроса | Перевод текста в вектор | 10-50 мс |
| Векторный поиск (retrieval) | Отбор top-50 кандидатов | 20-100 мс |
| Ре-ранкинг | Точная сортировка top-5 | 100-300 мс |
| Инъекция контекста + генерация | Формирование ответа на основе фрагментов | 1-5 сек |
Инъекция контекста: почему модель не может «придумать»
Финальные отобранные фрагменты не отправляются модели как справочная информация «для интереса» — они встраиваются прямо в системный промпт с явной инструкцией отвечать только на основании предоставленного контекста и указывать, если в контексте нет ответа. Структурно промпт выглядит как: системная инструкция → извлечённые фрагменты (карточки ингредиентов, данные о pH-стабильности, дозировках) → вопрос пользователя. Генеративная модель работает поверх этого текста так же, как она работала бы с любым другим контекстом — предсказывает наиболее вероятный следующий токен, но теперь «наиболее вероятное» продолжение — это пересказ и синтез конкретных фактов из карточки Retinol, а не статистическое усреднение по всему корпусу обучающих данных.
Это ключевой механизм снижения галлюцинаций: вероятность выдумывания падает не потому, что модель «стала умнее», а потому что задача изменилась с «сгенерируй факт» на «перескажи предоставленный факт» — а с этой задачей LLM справляются существенно надёжнее, что подтверждается сравнительными тестами RAG-архитектур против baseline-генерации (по данным Lewis et al., 2020, и последующих работ по факт-чекингу RAG-систем, включая Shuster et al., 2021, где частота фактических ошибок снижалась в 2-3 раза при подключении retrieval-компонента).
Почему это не просто «поиск + копипаста»
Важно понимать разницу между RAG и обычным поисковиком: система не просто возвращает найденный документ, а синтезирует ответ на конкретный вопрос пользователя, комбинируя несколько фрагментов — например, данные о стабильности ингредиента А из одной карточки и данные о его взаимодействии с ингредиентом Б из другой, формируя целостный вывод о совместимости в конкретной формуле. Генеративный слой остаётся необходимым — но он работает в жёстко ограниченном смысловом коридоре, заданном retrieval-этапом, а не в открытом пространстве всех возможных текстов о косметической химии, где и рождаются галлюцинации, описанные в предыдущей секции.
Верифицированная база INCI как фундамент: откуда берутся данные и как проверяется их точность
RAG-система работает ровно так же плохо, как и её источник данных, если этот источник не курируется. Разница между «ИИ-Химиком» и обычным чат-ботом с доступом в интернет — не в архитектуре нейросети, а в происхождении и качестве базы знаний, из которой модель извлекает факты перед генерацией ответа. Чтобы понять, почему верифицированная INCI-база — это не просто таблица с названиями ингредиентов, нужно разобраться, откуда берётся номенклатура и кто отвечает за её точность.
Что такое INCI и кто формирует номенклатуру
INCI (International Nomenclature of Cosmetic Ingredients) — это система унифицированных названий косметических ингредиентов, изначально разработанная американской ассоциацией Personal Care Products Council (PCPC, ранее CTFA). Именно PCPC ведёт основной реферативный источник — INCI Dictionary and Handbook, куда производитель обязан подать заявку на регистрацию нового ингредиента с указанием химической структуры, функции и метода получения.
В Евросоюзе параллельно существует регуляторный реестр CosIng (Cosmetic Ingredient Database), который ведёт Европейская комиссия. CosIng — не альтернатива INCI Dictionary, а регуляторная надстройка: здесь фиксируются ограничения по концентрации, статус запрета или условного разрешения, CAS- и EC-номера, а также ссылки на приложения Регламента (EC) №1223/2009 (Annex II, III, IV, V, VI). Без сверки с CosIng INCI-название превращается в пустой ярлык — оно говорит, что вещество существует, но не говорит, при какой концентрации оно легально в готовой формуле.
| Источник | Кто ведёт | Что фиксирует |
|---|---|---|
| INCI Dictionary and Handbook | PCPC (США) | Официальное название, химическая структура, CAS-номер, функция |
| CosIng | Европейская комиссия | Регуляторный статус, лимиты концентрации, приложения Annex II–VI |
| CIR (Cosmetic Ingredient Review) | Независимая экспертная панель | Оценка безопасности, NOAEL, допустимые дозировки |
| ECHA (REACH) | Европейское химическое агентство | Токсикологические данные, классификация CLP |
Для верифицированной базы, на которой строится RAG, каждая запись INCI не хранится изолированно — она связывается с этими четырьмя реестрами одновременно. Именно эта связка превращает список названий в структурированный источник истины.
Процесс верификации: от заявки до записи в базе
Курирование INCI-базы для retrieval-системы — это не разовая выгрузка данных, а непрерывный процесс кросс-валидации. Он строится по нескольким уровням проверки:
- Синтаксическая проверка — соответствие названия официальному написанию в PCPC Dictionary (учёт вариаций, устаревших синонимов, торговых названий типа Niacinamide vs. устаревшее «Nicotinamide»).
- Регуляторная кросс-сверка — сопоставление с CosIng на предмет запретов, ограничений по зоне применения (leave-on / rinse-off) и максимально допустимой концентрации.
- Токсикологическая проверка — привязка к отчётам CIR или SCCS (Scientific Committee on Consumer Safety), где фиксируются NOAEL и рекомендованные дозировки.
- Функциональная валидация — проверка заявленной функции ингредиента (эмульгатор, консервант, антиоксидант) против научной литературы, а не только маркетинговых описаний производителя.
Показательный пример — Sodium Ascorbyl Phosphate. Простая база данных зафиксирует только название и функцию «антиоксидант». Верифицированная база дополнительно свяжет запись с диапазоном рабочих концентраций 0,5–3%, стабильностью при pH 6–7 и данными о конверсии в аскорбиновую кислоту в коже (по данным Austria et al., 1997, и последующих обзоров стабильности производных витамина C). Именно эта многослойность не даёт модели «догадаться» о несуществующей дозировке — retrieval возвращает конкретное число из конкретного источника, а не статистически вероятную формулировку.
Почему это меняет качество ответа модели
Когда языковая модель работает без такой базы, она интерполирует ответ по паттернам из обучающей выборки — смеси форумов, маркетинговых сайтов и обрывков научных статей. Верифицированная база устраняет саму возможность интерполяции по неточным источникам: retrieval-слой физически не может подать в контекст модели то, чего нет в курируемом реестре. Это структурное ограничение, а не результат «более умного» промпта — и оно объясняет, почему RAG-система с такой базой систематически проигрывает обычному ChatGPT в скорости фантазии, но выигрывает в точности каждого конкретного числа.
Сравнительный эксперимент: как ChatGPT и ИИ-Химик отвечают на одинаковые вопросы про состав
Чтобы перейти от теории к практике, мы задали одинаковые три вопроса обычному ChatGPT (без плагинов и RAG-надстроек) и ИИ-Химику, работающему на верифицированной INCI-базе. Вопросы отражают три типичные задачи формулятора: оценка безопасности ингредиента, интерпретация процентной концентрации и распознавание синонимов INCI-названий одного и того же вещества.
Кейс 1: безопасность конкретного ингредиента — гидроксид алюминия в дезодорантах
Запрос: «Безопасен ли Aluminum Chlorohydrate в дезодоранте-антиперспиранте при концентрации 15%?»
ChatGPT дал развёрнутый, но противоречивый ответ: сначала сообщил, что «безопасность соединений алюминия в антиперспирантах подтверждена многочисленными исследованиями», затем в том же ответе упомянул «связь с болезнью Альцгеймера, доказанную рядом научных работ» — утверждение, которое давно опровергнуто и не подтверждается регуляторными органами (SCCS не находит причинно-следственной связи в своих отчётах). Модель смешала устаревшие гипотезы 1990-х с актуальным консенсусом, не указав источник и не разделив уровни доказательности.
ИИ-Химик ответил структурированно: указал допустимый диапазон концентрации (согласно регуляторным лимитам, не более 25% в пересчёте на сухое вещество алюминия для антиперспирантов), сослался на актуальный статус ингредиента в базе и отдельно отметил, что гипотеза о связи с болезнью Альцгеймера была опровергнута последующими когортными исследованиями (по данным Rogers, 2016, в масштабных обзорах ассоциация не подтверждена). Ответ содержал ссылку на конкретную запись в базе с датой последней верификации.
Кейс 2: интерпретация процентного содержания — ниацинамид и его верхний порог
Запрос: «Можно ли использовать Niacinamide в сыворотке в концентрации 12%?»
ChatGPT ответил утвердительно, сославшись на «популярность высоких концентраций в K-beauty продуктах» и не упомянул риск раздражения кожи или взаимодействие с кислотами. Модель фактически пересказала маркетинговые тексты брендов, которые преобладают в её обучающем корпусе, не различив коммерческий контент и клинические данные.
ИИ-Химик дал количественно обоснованный ответ: указал, что эффективность ниацинамида плато достигается в диапазоне 4–5%, а концентрации выше 10% статистически связаны с повышением частоты эритемы и жжения (по данным Bissett et al., 2004, и последующих клинических наблюдений). Дополнительно система предупредила о нежелательном сочетании с Ascorbic Acid при низком pH формулы — детали, которые требуют доступа к таблице совместимости ингредиентов, а не только к общему описанию вещества.
| Параметр ответа | ChatGPT | ИИ-Химик |
|---|---|---|
| Указан диапазон эффективности | Нет | Да, 4–5% |
| Упомянут риск при 12% | Нет | Да, с ссылкой на источник |
| Проверка совместимости с другими компонентами | Нет | Да |
Кейс 3: синонимы INCI-названий — путаница между формами витамина C
Запрос: «Это одно и то же — Sodium Ascorbyl Phosphate и Ascorbyl Palmitate?»
ChatGPT ответил, что «это разные формы одного вещества с одинаковым действием на кожу», фактически объединив два химически разных производных аскорбиновой кислоты с разной растворимостью, стабильностью и механизмом высвобождения активной формы витамина C. Ошибка возникла из-за того, что оба термина часто встречаются в одном контексте (антиоксидантные сыворотки), и модель статистически связала их без структурного анализа молекулы.
ИИ-Химик, обратившись к retrieval-модулю, извлёк отдельные карточки для каждого INCI-названия: Sodium Ascorbyl Phosphate — водорастворимая соль, стабильная в широком диапазоне pH; Ascorbyl Palmitate — липофильное производное, встраиваемое в масляную фазу эмульсии. Система явно указала на различие в применении и не позволила объединить их в один класс без уточнения.
Источник ошибки ChatGPT во всех трёх случаях один и тот же: модель генерирует правдоподобный текст на основе статистических паттернов в обучающих данных, а не проверяет факт против структурированной записи. Подробнее механизм такой генерации разобран в разделе про архитектуру retrieval-augmented generation (см. архитектура RAG), а здесь важно зафиксировать практический вывод: расхождение ответов не случайное, оно системное и повторяется на разных типах вопросов.
Химия ошибки: почему модель без RAG путает концентрации, синонимы и функциональные классы ингредиентов
Ошибки языковой модели в косметической химии не случайны — они системны и вырастают прямо из того, как устроена номенклатура INCI. Международная система названий строилась для унификации этикеток, а не для однозначного машинного парсинга: одна и та же кислота может фигурировать под пятью разными солевыми формами, один функциональный класс — прятаться за десятком торговых синонимов. LLM без внешнего контекста видит эти названия как статистически похожие токены, а не как разные молекулы с разной растворимостью, pH-стабильностью и биодоступностью.
Проблема солевых форм: одна кислота, разное поведение
Классический источник путаницы — производные аскорбиновой кислоты. Ascorbic Acid, Sodium Ascorbyl Phosphate, Magnesium Ascorbyl Phosphate и Ascorbyl Glucoside относятся к одному химическому семейству, но кардинально различаются по стабильности, оптимальному pH и рабочей концентрации. Модель, обученная на общем корпусе текстов, статистически ассоциирует все эти названия с «витамином С» и легко переносит параметры одной формы на другую — например, рекомендует 15-20% для Sodium Ascorbyl Phosphate, хотя эта соль эффективна уже при 5-10% и плохо растворяется при более высоких концентрациях.
Аналогичная история — с гиалуроновой кислотой. Sodium Hyaluronate и Hyaluronic Acid в текстах массовой культуры употребляются как взаимозаменяемые, но по молекулярному весу и глубине проникновения в кожу это разные истории. Без retrieval-слоя, подтягивающего точную запись из верифицированной базы, модель усредняет контекст и выдаёт правдоподобный, но химически неточный ответ.
| INCI-название | Функциональная особенность | Типичная ошибка LLM |
|---|---|---|
| Ascorbic Acid | Нестабильна, требует pH ниже 3.5 | Приписывает стабильность формам-производным |
| Sodium Ascorbyl Phosphate | Стабильна при нейтральном pH | Рекомендует концентрации как для чистой кислоты |
| Retinol | Жирорастворим, разлагается на свету | Путает с Retinyl Palmitate по силе действия |
| Niacinamide | Стабилен, широкий диапазон pH | Смешивает с Nicotinic Acid (другая молекула) |
Функциональные классы: когда модель не видит роль ингредиента в формуле
Вторая категория ошибок — смешение функциональных классов. Эмульгатор, солюбилизатор и ко-эмульгатор могут иметь схожую химическую природу (например, эфиры полисорбата), но выполняют разные задачи в формуле и требуют разных пропорций относительно фазы масел. Модель без структурированного контекста часто описывает Polysorbate 20 как прямой аналог Polysorbate 80, игнорируя разницу в HLB-значении (гидрофильно-липофильный баланс), которая определяет, для какой фазы — водной или масляной — подходит конкретный эмульгатор.
Похожая логика применима к консервантам. Список фраз-синонимов вокруг Phenoxyethanol в открытых источниках огромен, и без верифицированной привязки к конкретной регуляторной записи модель способна перепутать разрешённый диапазон концентраций (обычно до 1% по нормативам EU) с рекомендациями для комбинированных систем консервации, где реальная рабочая доза заметно ниже — 0.4-0.7%.
Почему статистическая языковая модель не различает контекст дозировки
Корень проблемы — в том, как трансформерная архитектура обрабатывает числовые данные. Токенизация чисел разбивает «0.5%» и «5%» на похожие последовательности символов, и без явного якоря на источник модель полагается на частотность паттернов в обучающих данных. Если в интернете чаще встречается связка «Retinol — 1%», модель будет генерировать эту цифру даже для случаев, когда речь идёт о нежных формулах для чувствительной кожи, где безопасный старт — 0.01-0.03%.
Исследование Ji et al. (2023) по систематизации галлюцинаций в языковых моделях отмечает, что подобные ошибки классификации особенно частотны там, где номенклатура строится на комбинаторных суффиксах и приставках — то есть именно в химии и фармакологии, где различие в один атом или одну соль меняет весь профиль безопасности вещества. Работа Ballentine и коллег по анализу INCI-номенклатуры (обсуждается также в материале /blog/inci-nomenklatura-oshibki-klassifikacii) показывает, что типичная ошибка классификации происходит на уровне «функциональной аналогии»: модель группирует ингредиенты по семантической близости названий, а не по реальной химической функции в рецептуре.
Синонимия как ловушка векторного пространства
Отдельный слой проблемы — торговые и тривиальные названия, которые в текстовом корпусе перемешаны с INCI-номенклатурой без явной разметки. «Витамин Е» может относиться и к Tocopherol, и к Tocopheryl Acetate — эстерифицированной форме с иной скоростью гидролиза в коже. Для человека это нюанс, для векторного представления в языковой модели — почти идентичные точки в пространстве эмбеддингов, потому что оба термина статистически появляются в одинаковых контекстах антиоксидантной защиты.
Именно эта смысловая слипчивость синонимов объясняет, почему retrieval-слой, подтягивающий точную запись из структурированной базы данных с уникальным идентификатором CAS-номера, а не просто «похожий по смыслу» текст, критически меняет качество ответа: он разрывает зависимость от статистической близости и заменяет её точным табличным соответствием.
Ограничения RAG-подхода: где даже верифицированная база не спасает от ошибок
RAG-архитектура закрывает главную проблему языковых моделей — генерацию фактов из «памяти» без опоры на источник. Но retrieval-augmented generation не превращает систему в оракула. У неё есть собственный набор слабых мест, и часть из них по природе не устранима одной лишь чисткой базы данных. Разберём, где даже безупречный источник знаний не гарантирует правильный ответ.
Устаревание базы: INCI-номенклатура и регуляторика живут своей жизнью
Верифицированная база — это снимок состояния знаний на момент индексации. INCI-названия периодически пересматриваются Personal Care Products Council, статусы ингредиентов в CosIng обновляются, появляются новые ограничения по концентрациям в EU Regulation 1223/2009. Если retrieval-слой обращается к базе, которая не синхронизирована с актуальными реестрами, система выдаст технически «подтверждённый источником» ответ — но источник устарел.
Практический пример: концентрационные лимиты для консервантов пересматриваются регулярно (как это было с рядом изотиазолинонов). База, обновлённая полгода назад, может содержать уже неактуальный порог — и RAG-система процитирует его с полной уверенностью, потому что формально «нашла подтверждение в документе».
Ошибки ре-ранкинга: релевантность ≠ правильность
После первичного поиска кандидатов ре-ранкер сортирует фрагменты по релевантности запросу — но релевантность и фактическая точность для конкретного вопроса — разные метрики. Ре-ранкер, обученный на эмбеддингах текста, может поставить выше документ, который лексически похож на запрос, но описывает смежный, а не искомый ингредиент.
Типичный сценарий: запрос про Retinyl Palmitate при слабой дифференциации эмбеддингов может подтянуть выше по рангу чанк про Retinol — химически связанные, но фармакологически разные по активности и переносимости соединения. Если топ-k ограничен тройкой фрагментов, а нужный документ про эфир ретинола попал на четвёртую позицию, генеративная модель просто не увидит его и составит ответ на основе смежного, но неточного контекста.
- Семантическая близость синонимов — функциональные классы (эмоленты, эмульгаторы) пересекаются в векторном пространстве, что путает ранжирование при нечётких запросах.
- Короткие чанки — если документ раздроблен слишком мелко, теряется контекст (например, дозировка указана в соседнем абзаце, не попавшем в топ-выборку).
- Доминирование частотных терминов — распространённые ингредиенты (например, Glycerin) чаще попадают в топ ре-ранкинга просто за счёт объёма упоминаний в базе, оттесняя редкие, но точные совпадения.
Неполное покрытие редких и нишевых ингредиентов
Верификация базы обычно фокусируется на массово используемых INCI-компонентах: консервантах, УФ-фильтрах, распространённых активах. Нишевые пептиды, редкие растительные экстракты или узкоспециализированные силиконовые производные часто представлены минимальным количеством документов — иногда единственным источником, часто на английском, без независимого перекрёстного подтверждения.
В таких случаях retrieval-слой физически не может предоставить генеративной модели альтернативные формулировки для сверки. Система вынуждена работать с единственным найденным фрагментом, и если в нём содержится опечатка в проценте концентрации или неверно указан функциональный класс — ошибка транслируется в ответ без каких-либо сигналов неопределённости.
| Тип ингредиента | Плотность документов в базе | Риск ошибки retrieval |
|---|---|---|
| Массовые консерванты, эмоленты | Высокая (десятки источников) | Низкий |
| Активы среднего распространения (Niacinamide, Sodium Ascorbyl Phosphate) | Средняя | Умеренный |
| Нишевые пептиды, редкие ботанические экстракты | Низкая (1–2 источника) | Высокий |
Нечёткие запросы пользователя: retrieval работает с тем, что дали
RAG-система извлекает документы на основе запроса — и если запрос сформулирован неточно или содержит бытовое название вместо INCI, качество извлечения падает пропорционально. Запрос «эта штука для увлажнения, которая как гиалуронка, но легче» может привести к retrieval низкомолекулярных полисахаридов, тогда как пользователь имел в виду конкретный Sodium Hyaluronate с определённой молекулярной массой.
По данным исследований, посвящённых устойчивости retrieval-систем к вариативности пользовательских формулировок (по Lewis et al., 2020; аналогичные наблюдения встречаются в работах по доменным RAG-системам), качество извлечения падает заметно при отклонении от терминологии, использованной при индексации корпуса. Это не проблема базы данных — это разрыв между разговорным языком пользователя и формальной номенклатурой источников.
Итог для практики: RAG-подход на верифицированной базе — это существенный шаг вперёд по сравнению с генерацией «из памяти» модели, но не абсолютная защита. Устаревание источников, слабости ре-ранкинга, дефицит данных по редким ингредиентам и чувствительность к формулировке запроса — все эти факторы требуют человеческого контроля на финальном этапе, особенно там, где ответ влияет на безопасность формулы.
Практические выводы: как выбирать AI-инструмент для анализа косметических формул
Разбор архитектуры, механизма галлюцинаций и слабых мест RAG-подхода подводит к главному вопросу: как на практике отличить инструмент, которому можно доверять при анализе INCI-состава, от генератора убедительно звучащего текста. Разница не сводится к бренду или маркетинговым обещаниям — она проверяется по конкретным техническим критериям.
Пять критериев проверки AI-инструмента перед внедрением в работу
Прежде чем доверить нейросети анализ формулы, разработчику косметики стоит задать инструменту (или его создателям) пять вопросов. Ответы на них показывают, работает ли система по принципу retrieval-augmented generation или это чистый генератор без верификации.
| Критерий | Что проверять | Красный флаг |
|---|---|---|
| Наличие RAG-слоя | Инструмент указывает источник каждого утверждения о концентрации, функции ингредиента | Ответ без ссылки на конкретную запись в базе |
| Прозрачность источников | Есть доступ к перечню баз данных (CIR, SCCS, CosIng и аналоги) | «Обучен на большом массиве данных» без деталей |
| Регулярность обновления базы | Дата последней синхронизации с регуляторными реестрами | База не обновлялась больше 6-12 месяцев |
| Обработка синонимов INCI | Корректно связывает торговые названия с INCI-номенклатурой | Путает Sodium Ascorbyl Phosphate с Ascorbic Acid |
| Признание неопределённости | Модель прямо говорит «данных недостаточно» при отсутствии записи в базе | Всегда даёт уверенный ответ на любой вопрос |
Если инструмент не может внятно ответить хотя бы на два из пяти пунктов — это сигнал использовать его результаты только как черновую гипотезу, требующую ручной проверки по первичным источникам.
Когда ChatGPT без RAG всё же допустим
Генеративные модели без retrieval-слоя не бесполезны — они хороши для задач, где не критична точность цифр: генерация идей для маркетингового текста, черновой структуры статьи, брейнсторминг названий продукта. Проблема начинается там, где на выходе модели принимается решение с последствиями для безопасности и стабильности формулы — расчёт % активного ингредиента, определение совместимости Retinol с AHA-кислотами, оценка pH-диапазона стабильности эмульсии.
Практическая рекомендация
Для рутинных задач — проверка концентрации консерванта, поиск синонимов INCI, сверка функциональных классов ингредиентов — инструмент на базе RAG с верифицированной INCI-базой снижает количество ошибок в разы по сравнению с генеративной моделью без retrieval-слоя. Это не отменяет критического чтения ответа: даже при RAG-архитектуре стоит проверять, на какой источник ссылается система, и относиться с осторожностью к ситуациям, описанным в разделе об ограничениях подхода — устаревшим записям, конфликтующим источникам, редким ингредиентам без достаточного покрытия в базе.
Итоговый критерий простой: доверие к AI-инструменту для анализа косметических формул должно расти пропорционально прозрачности его источников, а не убедительности тона ответа. Инструмент, который честно говорит «я не уверен, в базе нет актуальных данных по этому ингредиенту», ценнее того, что уверенно называет несуществующую концентрацию. Разработчикам, которые хотят системно разобраться в химии формул и параллельно освоить работу с такими инструментами, полезно начать с базовых курсов по INCI-анализу и рецептуре — это тот фундамент знаний, который позволяет отличить корректный ответ AI от галлюцинации даже без сверки с первичным источником.
Увидеть эту разницу на своих задачах можно в Клубе Формула крема: ИИ-Химик отвечает по верифицированной INCI/CosIng-базе, а не по «памяти» универсальной модели — плюс живой преподаватель и разбор ваших рецептур.



