[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-optical-character-recognition::ru":3,"gloss-cluster-optical-character-recognition::ru":20,"gloss-next-optical-character-recognition::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"optical-character-recognition","output","Оптическое распознавание символов (OCR)","Оптическое распознавание символов (OCR) — это технология, преобразующая изображения, содержащие текст, — сканы документов, сфотографированные чеки, скриншоты, PDF — в машиночитаемый, редактируемый и доступный для поиска текст. Классические движки OCR (Tesseract) использовали сопоставление шаблонов с образцами символов и работали приемлемо на чистом, контрастном печатном тексте, но испытывали трудности с рукописным текстом, перекошенными\u002Fповёрнутыми сканами, необычными шрифтами и сложной вёрсткой (таблицы, многоколоночный текст). Современный ИИ-OCR всё чаще использует визуально-языковые модели (мультимодальные LLM вроде GPT-4o, Claude и Gemini, или специализированные модели для документов вроде Google Document AI и AWS Textract), которые не просто распознают отдельные символы, а понимают структуру и семантику документа — корректно разбирая таблицу на строки и столбцы, отличая заголовок от подвала и извлекая конкретные поля (номер счёта, итоговая сумма, название поставщика) сразу в виде структурированного JSON, а не возвращая плоский неструктурированный текстовый блок, который приложению затем пришлось бы разбирать хрупкими регулярными выражениями. Почему это важно для SaaS-разработчиков: OCR — базовая инфраструктура для инструментов управления расходами и выставления счетов (автоматическое извлечение позиций из сфотографированного чека), платформ оцифровки документов (превращение бумажных архивов в доступные для поиска), процессов верификации личности\u002FKYC (извлечение имени\u002Fдаты рождения с фото паспорта) и автоматизации обработки форм. Современные пайплайны «OCR + LLM» в значительной степени вытеснили хрупкое извлечение полей на основе регулярных выражений\u002Fшаблонов, поскольку LLM способна обобщать на форматы документов, которые она никогда раньше не видела. Конкретный пример — SaaS учёта расходов автоматически заполняет чеки: (1) пользователь фотографирует бумажный чек на телефон, часто под углом, при люминесцентном освещении, слегка смятый; (2) изображение отправляется в мультимодальную LLM с промптом структурированного извлечения: «Извлеки следующие поля из этого изображения чека в формате JSON: merchant_name, date, total_amount, currency, line_items[]. Если поле неразборчиво, верни null для этого поля вместо угадывания. Изображение: {изображение}»; (3) модель возвращает `{\"merchant_name\": \"Blue Bottle Coffee\", \"date\": \"2026-06-28\", \"total_amount\": 14.50, \"currency\": \"USD\", \"line_items\": [...]}`; (4) приложение предзаполняет форму расходов этими полями, позволяя пользователю подтвердить и отправить за секунды вместо ручного ввода каждого поля, и подсвечивает любое поле, возвращённое моделью как `null`, чтобы пользователь знал, что его нужно заполнить вручную; (5) само изображение чека сохраняется и прикрепляется к записи расхода как аудиторское вложение, поскольку большинство правил политики расходов и налогового соответствия требуют оригинальный документ, а не только извлечённые данные. Точность на рукописном тексте, выцветших чеках на термобумаге и изображениях низкого качества или перекошенных остаётся главной причиной сбоев, поэтому промышленные процессы должны всегда выносить извлечённые поля на подтверждение пользователем перед сохранением, а не молча доверять автоматическому извлечению для финансовых записей.","OCR преобразует изображения печатного или рукописного текста — сканы, фото, PDF — в машиночитаемый, редактируемый текст.",null,[11,14,17],{"slug":12,"name":13},"retrieval-augmented-generation","Генерация с дополненным поиском (RAG)",{"slug":15,"name":16},"summarization","Суммаризация (Summarization)",{"slug":18,"name":19},"transcription","Транскрибация (Transcription)",[21,25,29,33,36,40,43,46,49,52,55,58],{"slug":22,"category":5,"name":23,"updated_at":24},"abstention","Отказ от ответа","2026-08-24T03:30:02+00:00",{"slug":26,"category":5,"name":27,"updated_at":28},"ai-copywriting","ИИ-копирайтинг","2026-08-24T02:46:38+00:00",{"slug":30,"category":5,"name":31,"updated_at":32},"ai-watermarking","Водяные знаки ИИ","2026-08-24T02:46:37+00:00",{"slug":34,"category":5,"name":35,"updated_at":32},"aspect-ratio-control","Управление соотношением сторон",{"slug":37,"category":5,"name":38,"updated_at":39},"audio-generation","Генерация звука (Audio Generation)","2026-08-24T02:46:36+00:00",{"slug":41,"category":5,"name":42,"updated_at":32},"audio-super-resolution","Аудио-суперразрешение",{"slug":44,"category":5,"name":45,"updated_at":39},"avatar-generation","Генерация аватара (Avatar Generation)",{"slug":47,"category":5,"name":48,"updated_at":39},"background-removal","Удаление фона (Background Removal)",{"slug":50,"category":5,"name":51,"updated_at":32},"batch-image-generation","Пакетная генерация изображений",{"slug":53,"category":5,"name":54,"updated_at":28},"brand-voice","Голос бренда",{"slug":56,"category":5,"name":57,"updated_at":28},"cfg-scale","CFG Scale (шкала classifier-free guidance)",{"slug":59,"category":5,"name":60,"updated_at":32},"character-consistency","Консистентность персонажа"]