ROUGE Score
ROUGE Score — метрика качества суммаризации текста
AI-метрикиROUGE Score (Recall-Oriented Understudy for Gisting Evaluation) — это набор метрик, используемых для автоматической оценки качества текста, сгенерированного компьютерной программой, по сравнению с эталонным текстом (или несколькими эталонными текстами), написанным человеком. Чаще всего ROUGE применяется для оценки систем суммаризации текста и машинного перевода.
Существует несколько вариантов ROUGE, каждый из которых по-разному измеряет пересечение слов или N-грамм (последовательности из N слов) между сгенерированным и эталонным текстами. Например, ROUGE-N сравнивает количество совпадающих N-грамм, ROUGE-L — самую длинную общую подпоследовательность, а ROUGE-S — пары пропущенных слов (skip-bigram). Высокий ROUGE Score обычно указывает на хорошее качество суммаризации или перевода, так как сгенерированный текст содержит много ключевых фраз из эталонного. Метрика позволяет быстро и объективно оценить большие объемы текста без участия человека, что критически важно для разработки и тестирования AI-моделей.
Примеры
Например, если эталонное предложение: "Кошка сидела на коврике", а сгенерированное предложение: "Кошка на коврике сидела", то ROUGE-1 (совпадение отдельных слов) будет высоким, а ROUGE-L (длинная общая подпоследовательность) также покажет хорошее совпадение, несмотря на изменение порядка слов.
В индустрии LLM, таких как GPT-4 или Claude, ROUGE Score регулярно используется для оценки качества абстрактной суммаризации длинных статей или документов. Исследователи могут сравнить ROUGE Score своей новой модели суммаризации с существующими бенчмарками, чтобы продемонстрировать улучшение в извлечении ключевой информации. Например, в соревновании по суммаризации новостей, модель, достигшая ROUGE-L 0.45, будет считаться лучше той, которая показала 0.38, при прочих равных условиях.
В методологии AIVO
AIVO активно использует ROUGE Score для оценки фактической согласованности и полноты информации, которую AI-модели генерируют о брендах клиентов. Мы мониторим ROUGE-N и ROUGE-L между AI-ответами и утвержденными брендовыми источниками. Это позволяет выявлять отклонения, рекомендовать оптимизацию контента и улучшать AI Visibility Growth Rate для наших клиентов.
Часто задаваемые вопросы
- Почему ROUGE Score не всегда отражает "человеческое" качество текста?
- ROUGE измеряет лексическое совпадение, что не всегда коррелирует с грамматикой, связностью или уникальностью текста. Сгенерированный текст может содержать те же слова, но быть плохо сформулированным, в то время как другой текст, используя синонимы, может быть намного лучше, но получить более низкий ROUGE.
- Какие есть альтернативы ROUGE Score для оценки суммаризации?
- Существуют другие метрики, такие как BLEU Score (чаще для машинного перевода), METEOR (учитывает синонимию и стемминг), BertScore (на основе эмбеддингов BERT). Для более глубокой оценки используются человеческие эксперты, оценивающие связность, достоверность и новизну информации.
