Atlas · GenAI 2026
ROUGE
Recall-oriented n-gram overlap metric, standard baseline for summarisation.
conceptPeak: 2016BenchmarkingAI consensus: 1/3
Prerequisites
No prerequisites.
Recommended reference
Lin, C.-Y. (2004) "ROUGE: A Package for Automatic Evaluation of Summaries" — ACL Text Summarization Workshop
Notes from AI deep research
Anthropic Opus
Jak BLEU: wygodne bo tanie, mylące bo recall n-gramów nie jest wiernością
OpenAI Deep Research
ROUGE nadal daje porównywalny punkt odniesienia dla streszczeń, pod warunkiem jawnego uznania ograniczeń semantycznych [OA]
Google Deep Think
Podobnie jak BLEU, traci znaczenie na rzecz ewaluacji semantycznej przez LLM, choć wciąż bywa punktem odniesienia [G]
Related skills
- → is subcategory of: LLM Evaluation Design(0/3)