Проще всего перевести PDF-документ с английского на русский прямо в браузере: он открывает файл и предлагает перевести страницу целиком одним нажатием. Но этот способ работает только с текстовым документом, а если файл на самом деле скан или фотография страницы, сначала нужно распознать текст и только потом переводить - иначе браузер переведёт случайный набор символов или вовсе ничего не найдёт.
Сначала проверяем, текстовый это документ или скан
Это первое, что стоит выяснить, потому что от ответа зависит весь дальнейший порядок действий. Открываем документ и пробуем выделить в нём кусок текста мышью. Если курсор выделяет отдельные буквы и слова, перед нами текстовый документ, и его можно переводить напрямую. Если же выделяется вся страница целиком как одна картинка, значит документ - это скан, и текста в привычном смысле в нём нет: для компьютера это просто изображение с буквами, а не буквы.
Спутать эти два случая легко, потому что внешне страница выглядит одинаково в обоих случаях. Разница проявляется только при попытке скопировать текст.
Есть и промежуточный случай: документ, где текст есть, но скопировать его не разрешает сам файл - автор защитил документ от копирования при сохранении. Внешне это выглядит так же, как со сканом: выделить ничего не получается, хотя буквы на экране выглядят обычным текстом, а не картинкой. Отличить одно от другого можно, попробовав увеличить страницу до предела - у настоящего скана буквы начнут размываться, а у текстового документа останутся чёткими при любом увеличении.
Как быть с документом, защищённым от копирования
Если текст в документе есть, но выделить его не удаётся из-за защиты, самый простой обходной путь - распечатать документ в новый файл через виртуальный принтер, создающий обычный файл вместо бумажной страницы. Получившаяся копия обычно уже без защиты копирования, потому что печать пересобирает содержимое страницы заново, но вместе с этим часто теряет текстовый слой - страница становится похожа на скан, даже если исходно им не была.
Если после такой пересборки текст снова не выделяется, дальше действуем так же, как со сканом: сначала распознаём буквы, а уже потом переводим полученный текст. Это на один шаг длиннее, чем прямой перевод, зато работает даже с документами, которые изначально не давали скопировать из себя ни строки.
Переводим прямо в браузере, не открывая отдельный переводчик
Современные браузеры умеют переводить открытую страницу целиком, и это касается не только сайтов, но и PDF-файлов, если открыть их прямо во вкладке браузера, а не в отдельной программе. Достаточно перетащить файл в окно браузера или открыть его через меню, а затем воспользоваться встроенным переводом - обычно значок с предложением перевести появляется сам, либо его можно вызвать через контекстное меню страницы.
Такой способ хорош тем, что не требует установки ничего дополнительного и подходит для быстрого ознакомления с содержанием документа. Минус - перевод получается построчным, без сохранения исходного оформления, и итоговый текст удобнее читать, чем распечатывать или пересылать как есть.
Стоит учитывать и качество определения языка: если документ многоязычный - например, инструкция сразу на нескольких языках в одном файле, - браузер иногда переводит не ту часть, которую нужно, или путает язык оригинала из-за соседних вставок. В таком случае разумнее выделить именно нужный фрагмент текста и перевести его отдельно, не полагаясь на автоматическое определение по всей странице сразу.
Что умеет функция перевода в программах для чтения документов
Отдельные программы для просмотра PDF встраивают перевод как одну из функций панели инструментов: выделяешь фрагмент - получаешь перевод во всплывающем окне, либо запускаешь перевод всего документа целиком с сохранением структуры страниц. Этот путь удобнее браузерного, если документ нужно не просто прочитать, а сохранить переведённую версию отдельным файлом для дальнейшей работы.
Важная деталь: качество перевода таблиц, схем и текста внутри изображений у большинства таких инструментов заметно хуже, чем у обычного текста в колонках. Если в документе много графиков с подписями, их разумнее переводить отдельно, а не полагаться на автоматический перевод всей страницы разом.
Многостраничный документ такая программа обычно переводит не весь целиком за одно нажатие, а показывает готовый перевод постранично, по мере обработки. Это удобно, если нужен только раздел из середины большого документа - можно сразу перейти к нужной странице, не дожидаясь перевода всего файла от начала до конца.
Как быть со сканом: сначала распознаём текст, потом переводим
Если документ оказался сканом, автоматический переводчик его просто не поймёт, сколько бы попыток мы ни делали, - для него это картинка, а не текст. Выход - сначала прогнать файл через распознавание текста, которое превращает изображение букв в настоящий текст, пригодный для копирования и перевода. Мы подробно разбирали этот процесс в статье о том, как распознать текст с картинки: те же принципы применимы и к отсканированной странице PDF.
После распознавания стоит бегло проверить результат: программы иногда путают похожие по начертанию буквы, особенно на страницах с нечётким сканом или рукописными пометками, и одна перепутанная буква способна изменить смысл слова при последующем переводе.
Качество скана сильно влияет на итоговый результат: чем ниже разрешение исходной фотографии или скана, тем чаще распознавание ошибается, а вслед за ним и перевод получает на входе искажённый текст. Если есть возможность пересканировать документ заново с более высоким качеством или сфотографировать страницу при хорошем освещении без бликов, лучше сделать это до распознавания, а не пытаться исправлять ошибки уже в переведённом тексте.
Переносим текст в офисную программу для перевода с сохранением абзацев
Если нужен не быстрый черновой перевод, а аккуратный документ с абзацами, заголовками и списками, разумнее скопировать распознанный или уже готовый текст в текстовый редактор и переводить его там частями. Так проще контролировать структуру: заголовки остаются заголовками, а не превращаются в сплошной абзац, как иногда случается при переводе PDF целиком через онлайн-сервисы.
Этот способ медленнее, зато даёт полный контроль над результатом: можно сверять перевод предложение за предложением с оригиналом, который остаётся открытым рядом, и сразу поправлять неудачные формулировки, а не искать их потом во всём документе.
Списки и нумерацию после переноса текста стоит проверить отдельно: при копировании из документа с колонками или таблицами строки иногда переставляются местами или объединяются в одну, и это не всегда заметно с первого взгляда. Сверка структуры перед переводом экономит время на исправлениях после - переводить заново перепутанный порядок пунктов приходится целиком, а не по одному предложению.
Что теряется при автоматическом переводе и как это поправить
Автоматический перевод хорошо справляется с обычным связным текстом, но у него есть слабые места. Термины и устойчивые выражения из узкой области он иногда переводит буквально, теряя изначальный смысл. Таблицы после перевода могут потерять выравнивание колонок, а подписи к рисункам - привязку к самим рисункам, если исходный документ был свёрстан сложно.
Если документ важный - договор, инструкция, официальная бумага, - переведённый вариант стоит перечитать целиком, обращая внимание именно на числа, даты и названия: автоматический переводчик иногда меняет порядок слов вокруг них так, что смысл искажается, хотя каждое отдельное слово переведено правильно. После правок готовый текст удобно снова конвертировать в PDF, чтобы получить документ в привычном формате для пересылки или печати.
Устойчивые обороты и специальные термины автоматический переводчик часто переводит дословно, не зная контекста узкой области - технической, юридической или медицинской. Слово, у которого в обычной речи одно значение, в конкретной отрасли может означать совсем другое, и машина об этом не догадывается. Если документ относится к незнакомой теме, разумно свериться хотя бы с парой спорных терминов отдельно, прежде чем полагаться на общий перевод целиком.
Когда проще не переводить документ целиком, а взять только нужную часть
Если из объёмного документа нужен перевод одной страницы или абзаца, не обязательно прогонять через переводчик весь файл. Быстрее выделить нужный фрагмент, скопировать его и вставить в переводчик отдельно - так меньше риск, что программа собьётся на длинном тексте или неправильно определит язык из-за смешанных вставок на английском и русском, которые встречаются в технических документах.
Этот способ особенно выручает с многостраничными инструкциями и техническими паспортами, где на английском языке написана лишь часть страниц, а остальное уже продублировано на русском - переводить продублированное заново нет смысла, и время лучше потратить на действительно непереведённые разделы.
Ещё один случай, когда полный перевод документа избыточен, - если нужно только понять общий смысл, а не получить готовый текст для отправки кому-то ещё. Тогда достаточно перевести заголовки разделов и первые предложения абзацев, чтобы понять структуру документа, и уже потом решать, какие именно части стоит перевести целиком, а какие можно оставить без перевода как второстепенные.