Перейти к содержимому
Справочно

Вопросы и ответы о машинном переводе

Вопросы, которые нам задают на переговорах: сколько стоит и от чего зависит цена, как измеряется качество, что нужно для обучения движка под вашу терминологию, сохранится ли вёрстка, как подключить перевод к вашим системам и что с безопасностью данных. Если ответа на ваш вопрос здесь нет — напишите, мы ответим и добавим его сюда.

Вопросы о машинном переводе для бизнеса

Чем машинный перевод отличается от перевода в бюро

Машинный перевод закрывает объёмы, недоступные человеку по срокам: 8 000 страниц проходят за день, тогда как бюро назовёт за тот же объём недели. Качество удерживается не вычиткой каждого сегмента, а конструкцией процесса — глоссарием, памятью переводов и автоматическим контролем на выходе. Человек подключается там, где документ требует финальной сверки, а не на каждой странице; за счёт этого стоимость получается примерно втрое ниже классического перевода.

Сколько стоит машинный перевод

Стоимость машинного перевода (ИИ-перевода) зависит прежде всего от сценария обработки и требований к результату. При переводе через API стоимость обычно рассчитывается за миллион символов и начинается примерно от 4 000 рублей за 1 млн символов. Для перевода документов чаще используется стоимость за слово. В полностью автоматическом режиме ориентир может составлять от 0,1 рубля до 1,5 рубля за слово и выше в зависимости от сложности технологической цепочки.

В базовом сценарии документ может переводиться одной специализированной или дообученной моделью. В более сложном корпоративном сценарии ИИ-перевод представляет собой многоэтапный автоматизированный процесс: подстановка данных из памяти переводов, перевод специализированной моделью, ИИ-постредактура, проверка и обеспечение терминологической точности, контроль качества перевода, проверка тегов и плейсхолдеров и другие автоматические проверки. Такая цепочка может учитывать отраслевые требования, корпоративные инструкции, глоссарии, референсные материалы и контекст документа. Все этапы выполняются автоматически, но глубина обработки и количество проверок напрямую влияют на стоимость.

Поэтому корректный ориентир для автоматического ИИ-перевода документов сегодня — примерно от 0,1 рубля за слово для перевода одной моделью до 1,5 рубля за слово и выше для многоэтапного корпоративного процесса с комплексным контролем качества.

Почему цены на машинный перевод так сильно различаются

Первая причина в том, что под одним словом скрываются разные продукты: поток перевода через API и готовый документ с контролем качества — это разные производственные цепочки и разные единицы измерения, символы против слов. Вторая — в том, что «машинный перевод» сегодня означает не одну технологию, а сценарий из нескольких, и стоимость определяет его устройство. Разницу в цене создают четыре вещи: какие модели участвуют — одна дообученная NMT или связка NMT и LLM с несколькими проходами; насколько технологичен производственный процесс — есть ли память переводов, выравнивание терминологии, автоматическая постредактура и контроль качества; насколько инженер сумел настроить систему под конкретный контент; и какие требования к финальному качеству ставит заказчик. Дешёвый перевод одной моделью и выверенная цепочка — это разные продукты, и сравнивать их по цене за слово без учёта сценария бессмысленно.

Какое качество даёт машинный перевод и как его измерить

Точность отраслевой терминологии в наших проектах — 99% по внутренним замерам, и это измеримая величина, а не оценка на глаз. Качество замеряется несколькими способами: BLEU показывает совпадение с эталонным переводом на уровне слов; COMET — нейронная метрика, оценивающая близость по смыслу, а не по совпадению формулировок, и она точнее согласуется с оценкой человека; Edit Distance показывает, сколько правок внёс редактор; MQM даёт разбор ошибок по типам и весам. Замер делается до и после обучения движка, поэтому прирост качества виден в цифрах.

Нужно ли редактировать машинный перевод человеком

Зависит от назначения документа: для внутреннего понимания правка не нужна, для публикации и регуляторных подач — нужна. Международный стандарт ISO 18587 описывает, как эту работу выполняет человек, и разделяет два уровня: light post-editing исправляет только смысловые ошибки, full post-editing доводит текст до уровня человеческого перевода.

Мы решаем ту же задачу технологически. Постредактированием занимается цепочка агентов: каждый последовательно дорабатывает текст на своём участке — смысл, терминология, стиль, форматирование, — а решение о том, достигнуто ли требуемое качество, принимает отдельная модель в роли судьи, LLM-as-a-judge. Глубина доработки задаётся требованиями к документу, а не количеством часов редактора: агенты идут друг за другом до тех пор, пока результат не пройдёт оценку.

Человек из процесса не исчезает: он проверяет результат в нашей CAT-системе, где рядом видны сегменты, память переводов, глоссарий и результаты автоматических проверок. Но его работа — контроль и финальная сверка, а не построчная правка всего документа.

На сколько языков вы переводите

Более 100 языков, включая редкие пары. Для основных направлений используются собственные движки, дообученные под отрасль, для остальных — подобранные под задачу модели с глоссарием и контролем терминологии. Подбор движка под конкретную языковую пару делается на вашем материале, до начала работы.

Цены ориентировочные и приведены для понимания порядка величин. Они не являются публичной офертой; стоимость работ определяется в Условиях оказания услуг и договоре после оценки ваших материалов.

Подробнее: Машинный перевод для бизнеса

Вопросы об обучении машинных движков

Что нужно, чтобы обучить движок под нашу терминологию

Нужны ваши прошлые переводы: параллельные корпуса, память переводов в формате TMX, двуязычные документы. Работа начинается с аудита данных — мы оцениваем объём и пригодность того, что есть, чистим корпус, выравниваем сегменты и убираем ошибочные пары. Если готовых переводов мало, движок настраивается через глоссарий и сценарий, а корпус накапливается по ходу работы.

Сколько данных нужно для дообучения модели

Универсального порога нет: решает не количество сегментов, а их однородность и чистота. Небольшой, но выверенный корпус по одной тематике даёт лучший результат, чем крупный архив смешанных переводов разного качества. Поэтому первым шагом идёт аудит: мы смотрим ваши материалы и говорим, хватает ли их для дообучения или разумнее начать с глоссария и сценария.

Чем дообучение NMT отличается от настройки LLM

Нейронную модель дообучают на данных, большую языковую модель настраивают инструкциями. Для NMT нужны параллельные корпуса: модель перестраивает веса под вашу лексику и синтаксис. Для LLM обучение заменяется инженерией сценария — системными инструкциями, примерами правильных переводов и правилами работы с контекстом документа. В производстве обычно работают обе: NMT на типовых сегментах, LLM там, где нужен контекст и стиль.

Как убедиться, что после обучения стало лучше

До обучения фиксируется базовый замер качества, после — повторный на том же материале. Сравниваются BLEU и COMET, Edit Distance и разбор ошибок по MQM, поэтому прирост выражается числом, а не формулировкой «стало лучше». Замеры делаются на ваших документах, а не на публичных наборах данных.

Где хранятся наши данные при обучении

Данные обрабатываются на серверах на территории России, трансграничная передача не осуществляется. Обученный на ваших материалах движок используется только для ваших задач. Внешние модели подключаются исключительно по согласованию с заказчиком; если это неприемлемо, весь контур разворачивается on-premise — на вашей инфраструктуре, без выхода в интернет.

Подробнее: Обучение машинных движков

Вопросы о форматах и вёрстке

Какие форматы файлов вы переводите

Офисные и обменные форматы: docx, xlsx, pptx, pdf, xml, json, po, xliff, md и другие. Обработка формата встроена в процесс — теги и плейсхолдеры шифруются перед переводом и восстанавливаются после, поэтому структура документа не рассыпается. Для специализированных форматов вроде AutoCAD и InDesign используются отдельные алгоритмы обработки.

Сохранится ли вёрстка после перевода

Да, документ возвращается в исходном оформлении: стили, таблицы, колонтитулы, нумерация, оглавления и подписи к рисункам остаются на местах. Развёрстка вручную не нужна — файл готов к использованию сразу после выгрузки. Это работает без CAT-системы: обработка формата идёт автоматически на входе и выходе.

Можно ли получить двуязычный документ

Да, мы настраиваем билингвальные формы выдачи: исходный текст и перевод размещаются последовательно — абзац за абзацем или в две колонки. Такой формат нужен для сверки, согласования с юристами и регуляторных подач, где требуется показать оригинал рядом с переводом.

Можно ли выдавать перевод по нашему шаблону

Да, перевод раскладывается в вашу форму: корпоративный бланк, отчётную форму или регуляторный шаблон. Формируется не копия исходника, а новый документ нужной структуры — это снимает ручную работу по переносу текста в бланк.

Подробнее: Форматы и вёрстка

Вопросы об интеграции

Как подключить машинный перевод к нашим системам

Есть четыре способа подключения, и выбор зависит от того, откуда приходят документы. Клиентский портал — когда сотрудники загружают файлы руками. REST API — когда перевод нужен в потоке продукта. Плагины к TMS и CAT — когда у вас уже есть система управления переводами и менять её не нужно. Коннекторы к документообороту, файловым хранилищам, CMS и репозиториям — когда документы должны уходить на перевод автоматически, по правилу.

Можно ли развернуть систему у нас, без выхода в интернет

Да, вариант on-premise разворачивается на вашей инфраструктуре в закрытом контуре без доступа в интернет. Есть три конфигурации: закрытый контур на нашей инфраструктуре в России, on-premise у вас и гибрид, где внешние модели подключаются только по вашему согласованию. Выбор контура согласуется с вашей ИТ-службой до начала работ; на разворачивание закрытого контура закладывайте больше двух месяцев, тогда как облачный портал запускается за две недели.

Есть ли API для машинного перевода

Да, REST API для продуктовых и контентных команд: перевод строк интерфейса, каталогов, описаний и пользовательского контента в потоке. Глоссарий и tone of voice применяются к вызовам API так же, как к документам, поэтому терминология в продукте и в документации остаётся единой.

Сколько занимает внедрение машинного перевода

Готовый облачный портал внедряется и настраивается за две недели. Разворачивание on-premise в закрытом контуре занимает, как правило, больше двух месяцев: основная часть срока уходит не на сам перевод, а на подготовку инфраструктуры и согласования на стороне заказчика. Внедрение в обоих случаях идёт одинаково: разбор схемы процесса, выбор контура и точек подключения, затем пилот на одном ограниченном участке — чтобы проверить качество и нагрузку на реальном потоке до масштабирования.

Придётся ли менять привычные инструменты команды

Нет, если у вас уже есть TMS или CAT — ИИ-сценарий подключается плагином, и команда продолжает работать в своём интерфейсе. Если собственной системы нет, финальная сверка проходит в нашей CAT-системе: сегменты, память переводов, глоссарий и результаты автоматических проверок в одном окне.

Подробнее: Интеграция в вашу среду

Вопросы об участии в тендерах

Какие документы вы предоставляете для тендера

Предоставляем сертификаты ISO 9001:2015, ISO 17100:2015 и соответствие ISO 18587, учредительные документы и реквизиты, а также пакет документации для проверки службой информационной безопасности. Комплект собирается под требования конкретной закупки — скажите, что нужно в вашей процедуре, и мы подготовим.

Можно ли проверить качество до заключения договора

Да, мы показываем качество на ваших реальных документах ещё на этапе выбора поставщика, до решения. Это не типовой демонстрационный текст, а ваш материал: вы видите, как система справляется с вашей терминологией и вашими форматами. Заодно показываем платформу и порталы — как настраиваются модели, глоссарии и контроль качества.

Соответствуете ли вы требованиям по защите данных

Обработка идёт на серверах на территории России в соответствии с Федеральным законом № 152-ФЗ, трансграничная передача не осуществляется. Для закупок с повышенными требованиями доступен вариант on-premise без выхода в интернет и анонимизация чувствительных данных. Пакет документов для ИБ-проверки предоставляется на этапе рассмотрения заявки.

Работаете ли вы с государственными заказчиками

Да, машинный перевод правительственной и ведомственной документации — одно из наших направлений. Обработка проходит в закрытом контуре на инфраструктуре в России, движки настроены на язык правовых баз и нормативных документов, терминология выравнивается по глоссарию заказчика.

Подробнее: Участие в тендерах

Вопросы о переводе медицинских документов

Можно ли переводить регистрационное досье машинным переводом

Да, и именно на таких объёмах машинный перевод даёт наибольший выигрыш: досье на 8 000 страниц проходит за день. Терминология сверяется с фармакопеей и вашим глоссарием, точность терминов — 99%. Для регуляторной подачи документ проходит постредактирование по ISO 18587 и выдаётся в билингвальном виде, если это требуется регулятором.

Какие медицинские документы вы переводите

Инструкции к лекарственным препаратам и медицинскому оборудованию, рецептуры, методики, стандарты, регистрационные досье и данные исследований. Отдельно работаем с публикациями для профильных изданий, где важна не только терминология, но и принятая в журнале структура текста.

Как обеспечивается конфиденциальность медицинских данных

Данные обрабатываются на серверах в России, трансграничная передача не осуществляется, обработка соответствует 152-ФЗ. Для неопубликованных исследований и данных пациентов доступен закрытый контур и вариант on-premise без выхода в интернет, а чувствительные данные могут анонимизироваться до перевода.

Кто отвечает за правильность медицинской терминологии

Терминология закрепляется в глоссарии до начала перевода и подставляется автоматически, а на выходе проверяется алгоритмами контроля. Мастер-глоссарий собирают лексикографы вместе с вашими специалистами, туда же вносятся запрещённые варианты перевода. Расхождения с глоссарием видны в отчёте о качестве, а не всплывают после сдачи.

Цены ориентировочные и приведены для понимания порядка величин. Они не являются публичной офертой; стоимость работ определяется в Условиях оказания услуг и договоре после оценки ваших материалов.

Подробнее: Медицина, фармацевтика и мед. организации

Вопросы о переводе в нефтегазовой отрасли

Как соблюдается терминология по ГОСТам

Отраслевые термины и обозначения по ГОСТам закрепляются в глоссарии и выравниваются на выходе автоматически. При переводе иностранных стандартов делается адаптация к принятым в России обозначениям, а не буквальный перенос. Расхождения фиксируются в отчёте автоматического контроля качества.

Какие документы переводятся в нефтегазовых проектах

Проектная и техническая документация, стандарты, регламенты, документы внешнеэкономической деятельности и переписка с зарубежными партнёрами. Объёмы здесь растут быстрее, чем их можно закрыть переводчиками, поэтому документация переводится потоком, со сверкой терминологии на каждом документе.

Можно ли работать с документами, не выходя во внешнюю сеть

Да, контур разворачивается on-premise на вашей инфраструктуре, без доступа в интернет. Это стандартное требование для проектной документации, и оно закрывается без ухудшения качества: движки, глоссарии и контроль качества работают в закрытом контуре так же, как в облаке.

Подробнее: Нефтегазовая промышленность

Вопросы о локализации ПО и цифровых продуктов

Как локализовать продукт с еженедельными релизами

Строки уходят на перевод прямо из репозитория и возвращаются готовыми, без отдельного этапа локализации в календаре релиза. Коннектор забирает изменённые строки по правилу, перевод применяет глоссарий продукта и tone of voice бренда, автоматический контроль проверяет плейсхолдеры и длину строк на каждой локали.

Поддерживаете ли вы форматы локализации

Да: json, po, xliff, xml и другие обменные форматы обрабатываются со всеми служебными элементами. Плейсхолдеры, переменные и теги разметки шифруются перед переводом и восстанавливаются после, поэтому строки не ломаются при сборке.

Как удержать единый стиль на всех языках

Tone of voice описывается инструкциями сценария и применяется одинаково ко всем локалям — от интерфейса до маркетинговых материалов. Терминология продукта закрепляется в глоссарии, поэтому одна и та же кнопка называется одинаково в интерфейсе, справке и документации.

Подробнее: IT-продукты, сайты и приложения

Вопросы о фармацевтическом портале

Что такое отраслевой портал перевода

Портал — это рабочее место, где сотрудник загружает документ и получает перевод за секунды, с сохранением формата и отраслевой терминологии. Внутри работает готовая производственная цепочка: подстановка из памяти переводов, перевод моделью, ИИ-постредактура, выравнивание терминологии и восстановление тегов. Настраивать ничего не нужно — сценарий уже собран под отрасль.

Чем портал лучше отправки файлов на почту

Перевод возвращается за секунды, а не после согласования сроков с исполнителем. Плюс порталом управляет ваша сторона: права доступа по отделам, лимиты, история документов и отчётность по объёмам. Документы не расходятся по личной почте сотрудников — это заметно и для ИБ-службы, и для бюджета.

Кто получает доступ к порталу

Доступ настраивается по отделам и ролям: администратор задаёт, кто может загружать документы, кто видит историю и какие лимиты действуют. Это позволяет открыть перевод широкому кругу сотрудников, не теряя контроля над тем, какие документы уходят в обработку.

Подробнее: Фармацевтический портал

Демо в реальном времени: ваш кейс, а не заготовка

Мы не просим ждать: на встрече вы даёте свой документ или релевантный файл из открытых источников — и видите перевод в реальном времени, с сохранением формата и отчётом о качестве. Так выглядит результат до настройки под вас. После настройки сценария под вашу терминологию он становится заметно лучше. 100+ языков.

Корпоративные решения только для юридических лиц.
Работает на платформе
Онлайн-встреча 30 минут. Демо на живых документах.
* Имя и компания обязательны; почта или телефон — достаточно одного. Документы и заявки обрабатываются на серверах в РФ. Пользовательское соглашение · Политика обработки ПД