Перейти к содержимому
Назад к глоссарию
Глоссарий

ROUGE Score

ROUGE Score — метрика качества суммаризации текста

AI-метрики

ROUGE Score (Recall-Oriented Understudy for Gisting Evaluation) — это набор метрик, используемых для автоматической оценки качества текста, сгенерированного компьютерной программой, по сравнению с эталонным текстом (или несколькими эталонными текстами), написанным человеком. Чаще всего ROUGE применяется для оценки систем суммаризации текста и машинного перевода.

Существует несколько вариантов ROUGE, каждый из которых по-разному измеряет пересечение слов или N-грамм (последовательности из N слов) между сгенерированным и эталонным текстами. Например, ROUGE-N сравнивает количество совпадающих N-грамм, ROUGE-L — самую длинную общую подпоследовательность, а ROUGE-S — пары пропущенных слов (skip-bigram). Высокий ROUGE Score обычно указывает на хорошее качество суммаризации или перевода, так как сгенерированный текст содержит много ключевых фраз из эталонного. Метрика позволяет быстро и объективно оценить большие объемы текста без участия человека, что критически важно для разработки и тестирования AI-моделей.

Примеры

Например, если эталонное предложение: "Кошка сидела на коврике", а сгенерированное предложение: "Кошка на коврике сидела", то ROUGE-1 (совпадение отдельных слов) будет высоким, а ROUGE-L (длинная общая подпоследовательность) также покажет хорошее совпадение, несмотря на изменение порядка слов.

В индустрии LLM, таких как GPT-4 или Claude, ROUGE Score регулярно используется для оценки качества абстрактной суммаризации длинных статей или документов. Исследователи могут сравнить ROUGE Score своей новой модели суммаризации с существующими бенчмарками, чтобы продемонстрировать улучшение в извлечении ключевой информации. Например, в соревновании по суммаризации новостей, модель, достигшая ROUGE-L 0.45, будет считаться лучше той, которая показала 0.38, при прочих равных условиях.

В методологии AIVO

AIVO активно использует ROUGE Score для оценки фактической согласованности и полноты информации, которую AI-модели генерируют о брендах клиентов. Мы мониторим ROUGE-N и ROUGE-L между AI-ответами и утвержденными брендовыми источниками. Это позволяет выявлять отклонения, рекомендовать оптимизацию контента и улучшать AI Visibility Growth Rate для наших клиентов.

Часто задаваемые вопросы

Почему ROUGE Score не всегда отражает "человеческое" качество текста?
ROUGE измеряет лексическое совпадение, что не всегда коррелирует с грамматикой, связностью или уникальностью текста. Сгенерированный текст может содержать те же слова, но быть плохо сформулированным, в то время как другой текст, используя синонимы, может быть намного лучше, но получить более низкий ROUGE.
Какие есть альтернативы ROUGE Score для оценки суммаризации?
Существуют другие метрики, такие как BLEU Score (чаще для машинного перевода), METEOR (учитывает синонимию и стемминг), BertScore (на основе эмбеддингов BERT). Для более глубокой оценки используются человеческие эксперты, оценивающие связность, достоверность и новизну информации.