Сравнение LLM: Кто лучше переводит художественный текст на английский и русский?
В мире, где генеративные модели становятся всё более востребованными, качество перевода — одна из самых острых тем. Недавно был проведен бенчмарк, который позволил сравнить возможности ведущих западных и китайских LLM в художественном переводе с английского на русский язык. Результаты оказались весьма показательными, выявляя как лидирующих игроков, так и нюансы работы каждой модели.
Как проходило тестирование качества перевода?
Методология оценки была выстроена на основе индустриального стандарта MQM и принципов школьных экзаменов. Это не просто субъективная оценка, а структурированный подсчет. В основу взят адаптированный рассказ О. Генри «The Skylight Room» 1906 года. Система оценки довольно детализирована: в текст встроено сто «ловушек» по двенадцати областям. Итоговый балл рассчитывается как процент, основанный на количестве пройденных точек, а не на свободной оценке от 0 до 100.
Важно понимать, что подсчет основан на кумулятивном результате — сумме областей минус штрафы, нормированном к ста. Это исключает субъективизм, который мог бы возникнуть при выставлении «оценки от 0 до 100» судьей.
Результаты бенчмарка: Лидеры в художественном переводе
По результатам тестирования, лидирующие позиции заняли две модели:
- Gemini 3.8 Flash показал впечатляющий результат в 91 из 100 по художественному переводу.
- GPT-6 Astra также продемонстрировал очень высокий уровень, набрав 90 из 100.
Нельзя обойти вниманием и китайских разработчиков. Модели DeepSeek V4.1 Flash и V4 Pro показали результат в 79 баллов, что позволило им сравняться с показателями Claude Opus.
[IMAGE]
query: comparison of LLM translation quality benchmark
subject: диаграмма сравнения результатов перевода разных языковых моделей
placement: после абзаца с результатами бенчмарка
alt: сравнение качества перевода разных языковых моделей
caption: Результаты бенчмаркинга показывают разные сильные стороны моделей.
[/IMAGE]
Плюсы и минусы разных подходов
Тестирование выявило не только лидеров, но и особенности работы каждой системы. Например, Claude Opus пишет очень гладко, но бенчмарк показал, что эта гладкость иногда приводит к пересказу материала, что является недостатком с точки зрения сохранения изначального смысла.
С другой стороны, Gemini Flash выделяется своей эффективностью. Он способен обеспечить экономию ресурсов без заметной потери качества, даже опередив флагманские модели в данном тесте. Это делает его интересным выбором для задач, где важна производительность и стоимость.
Когда стоит использовать разные модели?
Выбор инструмента зависит от задачи. Если вам нужен быстрый, но качественный черновик, который потом всё равно пройдет через сильного редактора, DeepSeek может оказаться оптимальным и более бюджетным решением, чем использование Opus.
Стоит помнить о методологических нюансах: при сравнении результатов, полученных разными моделями-судьями, может наблюдаться погрешность в диапазоне 2–3 баллов, поэтому соседние места с небольшой разницей в баллах лучше считать одним уровнем.
Итог: Выбор инструмента для перевода
Проведенный бенчмарк подчеркивает, что не существует универсального «лучшего» переводчика. Каждая модель имеет свои сильные стороны: от безупречной гладкости до высокой эффективности при сохранении точности. Выбор должен основываться на балансе между требуемым качеством, необходимой экономичностью и спецификой самого текста.