Atlas · GenAI 2026
BERTScore
Embedding-based generation metric — token similarity via BERT rather than n-gram overlap.
conceptPeak: 2021BenchmarkingAI consensus: 1/3
Prerequisites
No prerequisites.
Recommended reference
Zhang et al. (2020) "BERTScore: Evaluating Text Generation with BERT" — ICLR; arxiv.org/abs/1904.09675
Notes from AI deep research
Anthropic Opus
Metryka przejściowa: lepsza od BLEU, ale w 2026 wypierana przez LLM-as-Judge i metryki zadaniowe
OpenAI Deep Research
Zapewnia tani sygnał semantyczny do regresji, choć nie zastępuje ocen eksperckich ani testów zadaniowych [OA]
Google Deep Think
Wyparte przez nowocześniejsze metryki oparte na nowszych modelach LLM jako sędziach (LLM-as-a-judge) [G]
Related skills
- → is subcategory of: LLM Evaluation Design(0/3)