[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-embedding::ru":3,"gloss-cluster-embedding::ru":23,"gloss-next-embedding::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"embedding","core-ai","Эмбеддинг (векторное представление)","Эмбеддинг (embedding) — это массив чисел с плавающей точкой фиксированной длины, обычно от 256 до 3072 измерений, создаваемый нейросетью для представления смысла текста, изображения или аудио так, чтобы компьютеры могли сравнивать их математически. Ключевое свойство, делающее эмбеддинги полезными: семантически схожие входные данные дают векторы, близкие друг к другу в этом многомерном пространстве, тогда как несвязанные входные данные дают далеко расположенные векторы. Это фундамент почти каждой функции «AI понимает смысл» в современном SaaS — семантического поиска, ретривала для RAG, рекомендательных движков, кластеризации, дедупликации и классификаторов модерации контента. Эмбеддинги генерируются специализированными моделями (text-embedding-3 от OpenAI, embed-v3 от Cohere, Voyage AI или модели с открытыми весами вроде BGE и E5), которые отличаются от LLM, ориентированных на генерацию, — единственная задача модели эмбеддингов — выдать вектор, а не текст. Конкретный пример: если пропустить фразы «отменить мою подписку» и «как остановить ежемесячное списание» через одну и ту же модель эмбеддингов, получатся два вектора с высоким косинусным сходством (скажем, 0.89), хотя они почти не имеют общих слов — потому что модель усвоила, что они означают почти одно и то же. Сравните это с эмбеддингом «отменить мою подписку» против «какая сегодня погода», который даст низкий показатель сходства (скажем, 0.12). На практике разработчик вызывает API эмбеддингов вроде `POST https:\u002F\u002Fapi.openai.com\u002Fv1\u002Fembeddings {\"model\": \"text-embedding-3-small\", \"input\": \"отменить мою подписку\"}` и получает в ответ JSON-массив из 1536 чисел с плавающей точкой, который затем сохраняется в векторной базе данных для последующего поиска по сходству. Размерность эмбеддинга и выбор модели имеют значение: бо́льшая размерность улавливает больше нюансов, но дороже в хранении и поиске; а эмбеддинги разных моделей напрямую не сопоставимы друг с другом, поэтому пайплайн RAG должен использовать одну и ту же модель эмбеддингов и для индексации документов, и для кодирования запросов. Одна практическая ловушка, с которой разработчики сталкиваются рано: эмбеддинги разных моделей (или даже разных версий одной модели) живут в несовместимых векторных пространствах — вы не можете осмысленно сравнить эмбеддинг, созданный text-embedding-3 от OpenAI, с эмбеддингом от embed-v3 Cohere, хотя оба являются валидными эмбеддингами текста. Это означает, что смена модели эмбеддингов требует переиндексации всего корпуса документов с нуля — реальная стоимость миграции, которую стоит учитывать до того, как вы привяжетесь к одному поставщику в большом масштабе. Модели эмбеддингов также оцениваются по публичным бенчмаркам вроде MTEB (Massive Text Embedding Benchmark) — разумной отправной точке для сравнения качества ретривала между поставщиками перед выбором одного из них для продакшн-пайплайна RAG.","Эмбеддинг — это числовое векторное представление текста (или изображений\u002Fаудио), передающее смысл и позволяющее сравнивать понятия по сходству.",null,[11,14,17,20],{"slug":12,"name":13},"retrieval-augmented-generation","Генерация с дополненным поиском (RAG)",{"slug":15,"name":16},"semantic-search","Семантический поиск (Semantic Search)",{"slug":18,"name":19},"tokenizer","Токенизатор (Tokenizer)",{"slug":21,"name":22},"vector-database","Векторная база данных",[24,28,32,36,39,42,45,48,51,54,57,60],{"slug":25,"category":5,"name":26,"updated_at":27},"agentic","Агентный AI (Agentic AI)","2026-08-24T02:46:36+00:00",{"slug":29,"category":5,"name":30,"updated_at":31},"alignment-tax","Налог на выравнивание (Alignment Tax)","2026-08-24T02:46:37+00:00",{"slug":33,"category":5,"name":34,"updated_at":35},"artificial-intelligence","Искусственный интеллект (ИИ)","2026-08-24T02:46:38+00:00",{"slug":37,"category":5,"name":38,"updated_at":27},"attention","Внимание (Attention)",{"slug":40,"category":5,"name":41,"updated_at":35},"beam-search","Лучевой поиск",{"slug":43,"category":5,"name":44,"updated_at":31},"benchmark-contamination","Загрязнение бенчмарка (Benchmark Contamination)",{"slug":46,"category":5,"name":47,"updated_at":31},"catastrophic-forgetting","Катастрофическое забывание (Catastrophic Forgetting)",{"slug":49,"category":5,"name":50,"updated_at":35},"computer-vision","Компьютерное зрение",{"slug":52,"category":5,"name":53,"updated_at":31},"constitutional-ai","Конституционный ИИ (Constitutional AI)",{"slug":55,"category":5,"name":56,"updated_at":27},"context-window","Контекстное окно",{"slug":58,"category":5,"name":59,"updated_at":35},"deep-learning","Глубокое обучение",{"slug":61,"category":5,"name":62,"updated_at":27},"diffusion-model","Диффузионная модель (Diffusion Model)"]