Перейти к содержимому
Назад к глоссарию
Глоссарий

BLEU Score

BLEU Score — метрика качества машинного перевода

AI-метрики

BLEU (Bilingual Evaluation Understudy) Score — это широко используемая метрика для автоматической оценки качества текста, сгенерированного машинным переводом, по сравнению с одним или несколькими эталонными переводами, выполненными человеком.

Принцип работы BLEU заключается в подсчете совпадений n-грамм (последовательностей из N слов) между машинным переводом и эталонными переводами. Чем больше совпадений, особенно длинных n-грамм, тем выше оценка. Метрика также включает штраф за слишком короткие переводы, чтобы избежать получения высоких баллов за неполные фразы. Она выражается в значении от 0 до 1 (или от 0 до 100%).

Эта метрика необходима для быстрого и объективного сравнения различных систем машинного перевода, оптимизации их производительности и отслеживания прогресса в задачах NLP, таких как машинный перевод, суммаризация текста и генерация ответов. BLEU является первым шагом в оценке качества, позволяя исследователям и разработчикам количественно оценивать эффективность своих моделей без привлечения дорогостоящих человеческих экспертов на каждом этапе.

Примеры

Например, если эталонный перевод: "Кот сидит на коврике", а машинный перевод: "Кот сидит на циновке", BLEU будет искать совпадения n-грамм, такие как "Кот сидит", "сидит на", "на коврике" и "Кот сидит на". Высокое количество совпадений принесет высокий балл.

В 2018 году Google Translate использовал BLEU-скор для оценки улучшения качества своих систем после перехода на нейронные сети, демонстрируя значительный рост показателей по сравнению с предыдущими статистическими моделями.

Компания Amazon применяет BLEU для оценки качества перевода на своем маркетплейсе, чтобы убедиться в точности описаний товаров для покупателей в разных странах.

В методологии AIVO

В методологии AIVO, BLEU Score используется как одна из метрик для оценки качества генерации контента на основе LLM, особенно при мультиязычной оптимизации. Мы отслеживаем BLEU для оценки точности перевода брендового контента и соответствия эталонным текстам, помогая клиентам обеспечивать целостность бренда и фактологическую согласованность в различных языковых версиях.

Часто задаваемые вопросы

Почему BLEU Score не всегда является идеальной метрикой качества перевода?
BLEU фокусируется на лексических совпадениях и не всегда корректно оценивает семантическую эквивалентность, беглость или грамматическую правильность. Два перевода с одним и тем же смыслом, но использующие разные слова, могут получить разные BLEU-баллы. Он не учитывает синонимию или контекст.
Насколько высокий BLEU Score считается хорошим?
Идеальный BLEU Score равен 1.0 (или 100%), что означает идеальное совпадение с эталонным переводом. В реальных задачах машинного перевода, оценка выше 0.6 часто считается очень хорошей, но контекст и язык играют большую роль. Сравнение обычно производится относительно других систем или базовых линий.
Какие еще метрики используются для оценки качества перевода, помимо BLEU?
Помимо BLEU, часто используются ROUGE Score (ориентированная на полноту совпадений, особенно для суммаризации), METEOR (учитывает синонимы и морфологические вариации) и TER (Translation Edit Rate, измеряющая количество редактирований для трансформации машинного перевода в эталонный). Часто применяется смешанная оценка с участием человека.