APIMart
UniNote: единые мультимодальные эмбеддинги

UniNote: единые мультимодальные эмбеддинги

Узнайте, как UniNote от Xiaohongshu отображает текст, изображения, аудио и видео в единое пространство эмбеддингов для унифицированного поиска, ранжирования и извлечения данных.

Обзор модели

Основная идея Xiaohongshu проста: одна заметка, один эмбеддинг, один путь поиска. Вместо обработки текста, изображений, видео и аудио в отдельных системах UniNote помещает их в единое векторное пространство как для извлечения, так и для ранжирования.

Если свести статью к главному, вот что для меня важнее всего:

  • UniNote создает один мультимодальный эмбеддинг для каждой заметки
  • Используются два этапа обучения, включая функцию потерь InfoNCE и поиск сложных отрицательных примеров
  • Цель — использовать одну и ту же систему эмбеддингов для извлечения и ранжирования
  • Задача — улучшить кросс-модальный поиск, например сопоставление фотографии со страницей товара или видеофрагментом
  • В статье отмечается улучшение кросс-модального поиска, в том числе приводится результат до 26 процентных пунктов по NDCG@10 из связанного исследования общего пространства
  • Ограничения по-прежнему очевидны: расхождения в мелких деталях, ограничение временного окна видео от 3 до 25 секунд и ошибки ранжирования, когда сигналы не согласуются

Иными словами, речь не столько о добавлении еще одной модели, сколько об устранении разрозненных конвейеров для разных типов медиа. Для команд, работающих над поиском, лентами или подбором товаров, это может означать один индекс, более простой поток системы и меньше расхождений между извлечением и ранжированием.

Мой вывод прост: общие эмбеддинги могут упростить работу мультимодального поиска, но именно качество согласования по-прежнему определяет, насколько уместными выглядят результаты.

Qwen3-VL-Embedding и Qwen3-VL-Reranker: единая передовая платформа для мультимодального поиска

Qwen3-VL-Embedding

Как работает UniNote: архитектура, обучение и устройство извлечения и ранжирования

UniNote

Как работает UniNote: единый конвейер мультимодальных эмбеддингов
Как работает UniNote: единый конвейер мультимодальных эмбеддингов

Единое представление заметки для разных модальностей

UniNote сначала преобразует аудио, изображения и видео в общий формат заметки с помощью ASR, OCR и VLM, а затем отображает эти сигналы в единое векторное пространство. Каждая модальность проходит через собственный энкодер, после чего обучаемые проекционные слои переносят результаты в одно многомерное пространство. В итоге получается один эмбеддинг на заметку, сформированный из всех содержащихся в ней сигналов.

Такой подход дает Xiaohongshu единый конвейер для поиска по тексту, изображениям, видео и аудио. Вместо того чтобы рассматривать каждый формат как отдельный остров, система размещает их на одной карте.

Разумеется, это работает лишь в том случае, если модель обучается надежно согласовывать разные форматы.

Двухэтапное обучение и поиск сложных отрицательных примеров

UniNote использует двухэтапный подход.

На первом этапе применяется контрастивное обучение с функцией потерь InfoNCE. Так модель учится сближать соответствующий друг другу контент, даже если он представлен в разных форматах.

На втором этапе акцент смещается на качество ранжирования благодаря оптимизации с учетом релевантности и поиску сложных отрицательных примеров. Сложные отрицательные примеры — это элементы, которые выглядят близкими по контексту, но остаются неверными по смыслу. Это очень важно. Если модель умеет отличать почти подходящие результаты от настоящих совпадений, ранжирование становится точнее.

UniNote также использует эмбеддинги переменной длины. Это означает, что их можно сокращать, когда задаче не нужна полная точность. Проще говоря, система может пожертвовать частью детализации ради меньшего объема хранения и более быстрого поиска.

Затем один и тот же эмбеддинг может использоваться и для извлечения кандидатов, и для окончательного ранжирования.

Почему одна модель для извлечения и ранжирования упрощает устройство системы

Во многих рекомендательных системах одна модель используется для извлечения, а другая — для ранжирования. На бумаге это выглядит аккуратно. На практике между этапами может возникать рассогласование: одна модель усваивает одно представление о релевантности, а другая — немного иное.

UniNote избегает такого разделения. Одна платформа эмбеддингов используется и для извлечения, и для ранжирования, поэтому оба этапа остаются согласованными. Именно эта общая основа помогает извлечению и ранжированию одинаково работать в продакшене.

Следующий вопрос — насколько хорошо эта архитектура справляется с реальными задачами поиска.

Что показывает исследование: задачи, результаты и текущие ограничения

Задачи поиска «элемент к элементу» и охват бенчмарков

UniNote тестировали в задачах поиска «элемент к элементу». Проще говоря, модель пытается сопоставить один и тот же или связанный контент в разных форматах внутри единого пространства эмбеддингов.

Основной тест довольно прост: способен ли один эмбеддинг связывать контент разных форматов, не направляя поиск через отдельные конвейеры? Это важнее, чем может показаться на первый взгляд. Один и тот же эмбеддинг должен выполнять двойную работу. Он должен поддерживать и извлечение, и ранжирование, сохраняя при этом смысловую связь между модальностями.

Улучшение результатов кросс-модального поиска

На поисковых бенчмарках UniNote проверяется, может ли единое общее пространство повысить качество совпадений без отдельных конвейеров для каждой модальности. GR-CLIP, который повторно центрирует кластеры в общем пространстве эмбеддингов, повысил NDCG@10 на 26 процентных пунктов по сравнению со стандартным CLIP[1].

Это далеко не скромный прирост. В поисковых системах даже небольшое изменение метрик ранжирования может заметно повлиять на последующие рекомендации.

Однако бесплатных преимуществ не бывает. Эти улучшения сопровождаются компромиссами.

В чем единые эмбеддинги пока уступают

Единые эмбеддинги по-прежнему сталкиваются с трудностями, когда модальности плохо согласуются. В таких случаях система может неверно ранжировать результаты или выдавать ошибки, немного напоминающие галлюцинации. Производительность также может снижаться на контенте с мелкими деталями, особенно когда визуальные и текстовые сигналы указывают в разные стороны.

Видео — еще одно узкое место. Многие системы по-прежнему работают лишь с 3–25 секундами временного контекста, что жестко ограничивает объем смысла на уровне последовательности, который они могут учитывать.

Это становится еще более серьезной проблемой в быстро меняющихся поисковых и рекомендательных системах, обрабатывающих смешанный контент в большом масштабе.

Практическое применение в поиске, рекомендациях и мультимодальных ИИ-процессах

Улучшения поиска имеют значение лишь в том случае, если они упрощают работу поиска и рекомендаций в продакшене.

Кросс-модальный поиск и рекомендации для социальной коммерции и медиа

Главный сценарий использования эмбеддингов в стиле UniNote — поиск товаров и сопоставление контента. Благодаря единой системе эмбеддингов один запрос может сопоставить фотографию покупателя с карточкой товара, обзором автора или коротким видео, не заставляя команды строить отдельный конвейер для каждого формата.

Для социальной коммерции и медиа это особенно важно. Пользователь может загрузить скриншот, вставить подпись или выполнить поиск по названию товара. Если все эти входные данные находятся в одном пространстве эмбеддингов, у системы гораздо больше шансов вернуть связанные элементы в виде текста, изображений и видео.

Это также помогает рекомендациям. Связанные публикации, подписи и ролики остаются достаточно близкими друг к другу, чтобы обеспечить более точную кластеризацию контента и улучшить предложения в ленте. А с точки зрения эксплуатации команды могут поддерживать один индекс вместо нескольких, что заметно сокращает число дополнительных движущихся частей.

Особенности мультимодальной индексации, задержки и инфраструктуры

Переход к единой модели эмбеддингов напрямую меняет индексацию. Вместо отдельных векторных хранилищ для текста, изображений и видео команды могут объединить их в единый индекс приближенного поиска ближайших соседей (ANN). Это упрощает маршрутизацию запросов и снижает эксплуатационные расходы.

Видео добавляет еще один уровень сложности. Командам нужна предварительная обработка, которая сохраняет временные сигналы, не замедляя поиск. На практике это обычно означает:

  • Выборку кадров
  • Кодирование роликов через тот же мультимодальный конвейер
  • Поддержание скорости поиска, достаточной для продакшена

Такая схема также сокращает затраты на интеграцию моделей. Вам не приходится подключать один путь для текста, другой для изображений и еще один для видео. Конвейер становится проще, а значит, в дальнейшем его обычно легче обслуживать.

Как APIMart вписывается в единые мультимодальные процессы

APIMart

APIMart предоставляет доступ к текстовым, графическим и видеомоделям через одну OpenAI-совместимую конечную точку (api.apimart.ai/v1). Это сокращает расходы на контракты, аутентификацию и ограничения частоты запросов.

Для команд, создающих мультимодальные процессы, это означает, что один интеграционный слой может работать с разными типами моделей без переписывания связующего кода при каждом изменении. Инженеры сосредотачиваются на логике эмбеддингов и бизнес-логике, а не на управлении API.

Основные выводы для разработчиков и ИИ-команд

Что следует вынести из UniNote

После всех подробностей об извлечении и инфраструктуре главный вывод касается эксплуатации: UniNote использует одно семантическое пространство для мультимодального поиска и ранжирования. Это важно, поскольку отдельные конвейеры в большом масштабе часто приводят к непоследовательным результатам.

Проще говоря, вы получаете меньше переходов между модальностями и меньше расхождений в ранжировании. Для разработчиков это означает меньше движущихся частей в кросс-модальном поиске. Сопоставлять изображения товаров с описаниями, связывать короткие видео с подписями и выполнять мультимодальный поиск для социальной коммерции становится проще, когда один эмбеддинг отвечает и за извлечение, и за ранжирование, без набора отдельных моделей для каждого формата.

Практический шаг очевиден. Стройте индексацию, извлечение и рекомендации вокруг единого семантического пространства, чтобы новые модальности можно было подключать без перестройки конвейера. Один индекс, одна логика ранжирования, меньше точек интеграции.

Часто задаваемые вопросы

Как создается один эмбеддинг из смешанных медиа?

UniNote и подобные системы создают единый эмбеддинг, отображая текст, изображения, видео и аудио в общем семантическом векторном пространстве.

Обычно они используют модели на основе трансформеров для преобразования каждого типа входных данных в единое представление. Затем применяются кросс-модальное внимание и проекционные слои, чтобы одна и та же идея согласовывалась между форматами. Благодаря этому система может измерять семантическое сходство между разными видами медиа.

Зачем использовать один и тот же эмбеддинг для извлечения и ранжирования?

Использование одного и того же эмбеддинга для извлечения и ранжирования удерживает все данные в общем семантическом пространстве. Это важнее, чем может показаться на первый взгляд.

Когда текст, изображения и видео отображаются одинаковым способом, их можно сравнивать напрямую. Текстовый запрос может соответствовать изображению. Видео может совпасть с текстовым описанием. Связанный контент остается синхронизированным между форматами, а не расходится со временем.

Это улучшает кросс-модальный поиск и извлечение, сокращает разрыв между модальностями и помогает рекомендательным конвейерам оставаться стабильными и последовательными.

Каковы главные ограничения UniNote сегодня?

UniNote сталкивается с основными ограничениями при попытке разместить текст, изображения, видео и аудио в одном семантическом пространстве. В теории это звучит стройно. На практике эти модальности не согласуются сами по себе, поэтому обучение усложняется, а выученные представления могут оказаться слабее.

При совместном обучении возникает и другая проблема: лень модальности или конфликт. Проще говоря, модель может слишком сильно опираться на самый простой входной сигнал и уделять меньше внимания остальным. В результате некоторые модальности остаются недостаточно обученными. А когда реальные данные неполны, например отсутствует аудио, проблема усугубляется. Модель может в целом работать хуже или чрезмерно зависеть от той модальности, которая оказалась самой сильной.

Готовы попробовать?

Выберите нужную модель в маркетплейсе моделей

Попробуйте чат, изображения и видео в маркетплейсе APIMart и быстро оцените возможности моделей через единый API.

Чат-моделиМодели изображенийВидео-модели
Открыть маркетплейс моделей