Atlas · GenAI 2026
BLEU
N-gram precision metric from machine translation; weak proxy for open-ended LLM output.
conceptPeak: 2015BenchmarkingAI consensus: 0/3
Prerequisites
No prerequisites.
Recommended reference
Papineni et al. (2002) "BLEU: a Method for Automatic Evaluation of Machine Translation" — ACL
Notes from AI deep research
Anthropic Opus
Relikt ery tłumaczenia maszynowego; przy otwartych generacjach mierzy zgodność powierzchniową, nie sens
OpenAI Deep Research
BLEU pozostaje historycznym punktem odniesienia, lecz słabo mierzy użyteczność swobodnych odpowiedzi modeli [OA]
Google Deep Think
Przestarzała metryka w erze modeli generatywnych, zupełnie nieprzydatna do oceny kreatywnego tekstu [G]
Related skills
- → is subcategory of: LLM Evaluation Design(0/3)