Когда ИИ уже почти не стыдно читать, но всё равно хочется человека
Вокруг машинного перевода литературы давно витает один и тот же вопрос: если нейросеть уже умеет более-менее точно передать смысл, значит ли это, что она умеет переводить роман как роман — с голосом, ритмом, атмосферой и тем самым ощущением, когда текст «несёт»?
Новая работа с прямолинейным выводом в названии отвечает честно: переводы ИИ уже «нормальные», но читатели всё равно чаще выбирают человеческий перевод. И это, пожалуй, самый интересный результат. Не потому, что «машины проиграли». А потому, что разрыв оказался куда тоньше, чем многим хотелось бы, и куда важнее — по каким именно причинам человек пока выигрывает.
Исследователи не стали измерять всё привычными автоматическими метриками. Вместо этого они посадили 15 активных читателей за реальные отрывки из современных романов — французских, польских и японских, переведённых на английский. Дали им сначала читать большие куски как обычную книгу, а потом — разбирать переводы вблизи, фрагмент за фрагментом. Получился редкий случай, когда вопрос о качестве перевода задали не моделям и не разметчикам, а самим читателям.
Что именно проверяли
Авторы собрали набор из 15 книжных отрывков объёмом примерно по 8 тысяч слов. Для каждого был профессиональный опубликованный перевод на английский и машинный перевод, созданный не «одним запросом», а через многошаговый конвейер с LLM и агентами для программирования. То есть это не слабый базовый машинный перевод, а, скорее, одна из лучших доступных сегодня попыток сделать литературный перевод с помощью ИИ.
Сначала участники читали один вариант отрывка целиком, потом другой. После каждого оценивали, насколько текст гладкий, приемлемый для публикации, помогает ли он погружению и хочется ли читать дальше. Затем сравнивали обе версии напрямую. А через день возвращались к тем же текстам уже в режиме медленного чтения: смотрели на выровненные куски примерно по 300 слов, отмечали удачные и неудачные места и выбирали, какой вариант лучше.
Схема эксперимента: сначала обычное чтение длинного отрывка, потом сравнение двух версий, а через день — внимательное сопоставление коротких фрагментов.
Обычно машинный перевод оценивают по коротким предложениям или абзацам. Но литература так не работает. Роман живёт не только в точности слов, а в том, насколько легко ты входишь в сцену, слышишь интонацию героя и не спотыкаешься каждые три строки. Авторы как раз и пытались поймать эту разницу между «в целом читается» и «это действительно хороший литературный перевод».
Почему это вообще важно
Потому что машинный перевод художественных текстов уже не эксперимент из лаборатории. Издатели тестируют его для коммерческих книг. Платформы предлагают авторам быстро выходить на новые рынки. А значит, читатель очень скоро — а местами уже сейчас — может купить роман, не зная, насколько глубоко в его переводе участвовал человек.
Проблема в том, что привычные метрики здесь слабо помогают. Они неплохо улавливают адекватность смысла или общую гладкость. Но почти не видят, есть ли у текста дыхание, держит ли он темп, не разваливается ли голос повествования между абзацами. И вот эта работа показывает: если смотреть только на автоматические оценки, можно сделать слишком оптимистичный вывод о качестве ИИ-перевода.
Как делали машинный перевод
Отдельно интересно, что исследователи не сравнивали людей с примитивной схемой «взяли модель и попросили перевести». Они сначала протестировали несколько вариантов конвейера и выбрали лучший.
Финальная схема выглядела так: текст делили на части, к нему добавляли стилистические указания, затем один агент переводил куски, другие проверяли качество — и с точки зрения точности, и с точки зрения литературности. Если находились проблемы, кусок отправляли на доработку. Потом собранный черновик ещё раз проверяли уже на уровне всего отрывка: на согласованность, цельность, сохранение голоса.
Конвейер литературного перевода с ИИ: разбиение на части, перевод, локальная ревизия и финальная проверка целого текста.
То есть перед нами не «сырое» машинное решение, а довольно дорогой и продуманный процесс. Именно поэтому результаты особенно показательны: даже при таком подходе человеческий перевод остаётся впереди.
Главный результат: ИИ уже приемлем, но человек всё ещё лучше
Если смотреть на длинные отрывки целиком, преимущество человеческого перевода есть, но не разгромное: в 19 из 30 случаев читатели предпочли именно его. А вот при медленном чтении разница стала куда заметнее: из 772 сравнений коротких фрагментов 522 оказались в пользу человеческого перевода и только 250 — в пользу машинного.
Распределение предпочтений читателей: после чтения длинных отрывков и после медленного чтения коротких фрагментов человеческий перевод выигрывает чаще.
Это очень показательно. Пока читаешь длинный кусок без прямого сравнения, машинный перевод часто кажется вполне нормальным. Он не обязательно раздражает. Он может быть гладким, понятным, местами даже увлекательным. Но когда два варианта ставят рядом, становится видно, где именно человек поработал глубже и тоньше.
Авторы отдельно спрашивали, что именно лучше у одного или другого варианта. Человеческие переводы чаще получали высокие оценки за гладкость, ясность и погружение. Читатели чаще говорили, что такой текст «проще читать», что он не заставляет перечитывать фразу, лучше удерживает внутри сцены и естественнее звучит по-английски.
При этом машинный перевод вовсе не выглядел провалом. Примерно в трети фрагментов он побеждал. Иногда — из-за удачного локального выбора слова. Иногда — потому что звучал живее или точнее попадал в регистр реплики. То есть ИИ уже умеет делать хорошие отдельные решения. Но стабильности пока не хватает.
Где именно человек выигрывает
Самая интересная часть работы — не голые проценты, а то, почему читатели выбирали один вариант вместо другого.
Человеческий перевод чаще выигрывал за счёт того, что текст легче течёт. Не в смысле «там меньше ошибок», а в смысле читательского опыта: не спотыкаешься, не вылетаешь из сцены, не пытаешься распутать странный порядок слов. Читатели постоянно отмечали ясность, естественность, ритм, удобство следования за действием и диалогами.
Машинный перевод, напротив, нередко страдал от локальных сбоев: слишком буквальная фраза, не тот оттенок слова, перегруженное предложение, внезапная шероховатость в диалоге. Причём ключевая проблема была не в том, что он всегда плох, а в том, что он неравномерен. Сегодня абзац отличный, через два абзаца — неловкая формулировка, которая портит впечатление.
У машинного перевода заметно больше фрагментов с высокой плотностью неудачных мест, отмеченных читателями как слабые.
Авторы как раз измерили эту неравномерность через разметку «хороших» и «плохих» участков. Оказалось, что у машинного перевода слабые места гораздо чаще концентрируются плотными сгустками. То есть проблема не только в среднем качестве, а в том, что внутри одного и того же отрывка ИИ сильнее скачет от удачи к неудаче.
Для художественного текста это критично. В новостной заметке вы, возможно, простите пару странных фраз. В романе одна-две фальшивые ноты в нужный момент могут разрушить атмосферу сцены или смазать характер героя.
ИИ трудно распознать — и это, возможно, самый тревожный вывод
Пожалуй, самый любопытный результат: читатели не смогли надёжно отличать машинный перевод от человеческого. После прямого сравнения двух версий они правильно угадывали машинный вариант лишь в 17 случаях из 30 — то есть почти на уровне случайности.
Точность распознавания машинного перевода близка к случайной даже после сравнения двух версий текста.
Более того, люди почти всегда считали, что предпочитаемый ими вариант сделан человеком. Это мощный психологический эффект. Мы не просто оцениваем текст — мы достраиваем вокруг него представление об авторстве, намерении и качестве.
Исследование показывает ещё одну забавную и важную вещь: читателей часто сбивали с толку ложные «признаки ИИ». Кто-то видел длинные тире и решал, что это машина. Кто-то думал, что ИИ «не станет так ругаться». Кто-то принимал за машинность просто непривычный стиль. Иными словами, народные теории о том, как «должен звучать ИИ», работают плохо.
Это важно не только для перевода. Вокруг текстов ИИ вообще много переоценённой уверенности: люди уверены, что распознают машинный текст, но на практике часто ошибаются.
А что с автоматическими метриками? Всё плохо
Вот где работа особенно неприятна для любителей простых чисел. Исследователи сравнили читательские предпочтения с автоматическими метриками качества, включая подходы, где текст оценивает сама LLM. И оказалось, что метрики систематически склоняются в пользу машинного перевода — то есть фактически идут против человеческого чтения.
Если вы делаете продукт для издательства и смотрите только на автоматическую оценку, можно решить, что машинный вариант уже едва ли не лучше человека. Но живые читатели говорят обратное: да, читать можно, но человек по-прежнему даёт более лёгкий, ясный и погружающий опыт.
Причина понятна. Метрики хорошо видят близость к смыслу, формальную гладкость, иногда согласованность. Но они плохо улавливают то, что особенно важно в литературе: ритм, голос, ощущение естественного движения фразы, плотность слабых мест и то, как локальная шероховатость ломает общий эффект.
Важная оговорка: это прежде всего история про перевод на английский
Авторы честно признают ограничения. Основной эксперимент — это переводы с французского, польского и японского на английский. А английский сегодня — самый сильный язык для LLM. И даже в этом «лучшем случае» человек всё равно выигрывает.
Когда исследователи сделали небольшой дополнительный разбор переводов в другие языки — французский, польский, испанский и японский, — преимущество человеческого перевода оказалось ещё заметнее. Там ИИ чаще ловили за руку и чаще отвергали.
Из этого следует простой вывод: если даже на английском разрыв сохраняется, то в других языковых направлениях он может быть ещё больше.
Что в сухом остатке
Это очень трезвая работа. Она не впадает ни в технооптимизм, ни в алармизм.
Вывод звучит так: машинный перевод литературы уже достиг уровня «это можно читать». Иногда он даже выигрывает. Иногда его трудно распознать. Иногда он выглядит удивительно сильным. Но если спрашивать не «понятен ли смысл», а «какой текст читатель хочет продолжать как роман», то преимущество остаётся за человеком.
Причём выигрывает человек не за счёт магии, а за счёт вещей, которые особенно важны в литературе: плавности, ясности, естественного выбора слов, удержания голоса и общей стабильности по ходу текста.
Для индустрии это, пожалуй, главный практический вывод. ИИ уже вполне годится как инструмент черновика, как помощник, как ускоритель работы. Но идея «давайте просто выпускать романы в машинном переводе, читатель не заметит» пока слишком самоуверенна. Читатель, может, и не всегда поймёт, где машина. Но когда рядом лежит хороший человеческий перевод, он всё ещё чаще выбирает его.
И, возможно, это лучший комплимент профессии переводчика из всех возможных.
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram