Atlas · GenAI 2026

ROUGE

Recall-oriented n-gram overlap metric, standard baseline for summarisation.

conceptPeak: 2016BenchmarkingAI consensus: 1/3

Prerequisites

No prerequisites.

Recommended reference

Lin, C.-Y. (2004) "ROUGE: A Package for Automatic Evaluation of Summaries" — ACL Text Summarization Workshop

Notes from AI deep research

Anthropic Opus

Jak BLEU: wygodne bo tanie, mylące bo recall n-gramów nie jest wiernością

OpenAI Deep Research

ROUGE nadal daje porównywalny punkt odniesienia dla streszczeń, pod warunkiem jawnego uznania ograniczeń semantycznych [OA]

Google Deep Think

Podobnie jak BLEU, traci znaczenie na rzecz ewaluacji semantycznej przez LLM, choć wciąż bywa punktem odniesienia [G]

Related skills