BLEU (Bilingual Evaluation Understudy) Score — это широко используемая метрика для автоматической оценки качества текста, сгенерированного машинным переводом, по сравнению с одним или несколькими эталонными переводами, выполненными человеком.
Принцип работы BLEU заключается в подсчете совпадений n-грамм (последовательностей из N слов) между машинным переводом и эталонными переводами. Чем больше совпадений, особенно длинных n-грамм, тем выше оценка. Метрика также включает штраф за слишком короткие переводы, чтобы избежать получения высоких баллов за неполные фразы. Она выражается в значении от 0 до 1 (или от 0 до 100%).
Эта метрика необходима для быстрого и объективного сравнения различных систем машинного перевода, оптимизации их производительности и отслеживания прогресса в задачах NLP, таких как машинный перевод, суммаризация текста и генерация ответов. BLEU является первым шагом в оценке качества, позволяя исследователям и разработчикам количественно оценивать эффективность своих моделей без привлечения дорогостоящих человеческих экспертов на каждом этапе.
Примеры
Например, если эталонный перевод: "Кот сидит на коврике", а машинный перевод: "Кот сидит на циновке", BLEU будет искать совпадения n-грамм, такие как "Кот сидит", "сидит на", "на коврике" и "Кот сидит на". Высокое количество совпадений принесет высокий балл.
В 2018 году Google Translate использовал BLEU-скор для оценки улучшения качества своих систем после перехода на нейронные сети, демонстрируя значительный рост показателей по сравнению с предыдущими статистическими моделями.
Компания Amazon применяет BLEU для оценки качества перевода на своем маркетплейсе, чтобы убедиться в точности описаний товаров для покупателей в разных странах.
В методологии AIVO
В методологии AIVO, BLEU Score используется как одна из метрик для оценки качества генерации контента на основе LLM, особенно при мультиязычной оптимизации. Мы отслеживаем BLEU для оценки точности перевода брендового контента и соответствия эталонным текстам, помогая клиентам обеспечивать целостность бренда и фактологическую согласованность в различных языковых версиях.
Часто задаваемые вопросы
- Почему BLEU Score не всегда является идеальной метрикой качества перевода?
- BLEU фокусируется на лексических совпадениях и не всегда корректно оценивает семантическую эквивалентность, беглость или грамматическую правильность. Два перевода с одним и тем же смыслом, но использующие разные слова, могут получить разные BLEU-баллы. Он не учитывает синонимию или контекст.
- Насколько высокий BLEU Score считается хорошим?
- Идеальный BLEU Score равен 1.0 (или 100%), что означает идеальное совпадение с эталонным переводом. В реальных задачах машинного перевода, оценка выше 0.6 часто считается очень хорошей, но контекст и язык играют большую роль. Сравнение обычно производится относительно других систем или базовых линий.
- Какие еще метрики используются для оценки качества перевода, помимо BLEU?
- Помимо BLEU, часто используются ROUGE Score (ориентированная на полноту совпадений, особенно для суммаризации), METEOR (учитывает синонимы и морфологические вариации) и TER (Translation Edit Rate, измеряющая количество редактирований для трансформации машинного перевода в эталонный). Часто применяется смешанная оценка с участием человека.
