Atlas · GenAI 2026

BLEU

N-gram precision metric from machine translation; weak proxy for open-ended LLM output.

conceptPeak: 2015BenchmarkingAI consensus: 0/3

Prerequisites

No prerequisites.

Recommended reference

Papineni et al. (2002) "BLEU: a Method for Automatic Evaluation of Machine Translation" — ACL

Notes from AI deep research

Anthropic Opus

Relikt ery tłumaczenia maszynowego; przy otwartych generacjach mierzy zgodność powierzchniową, nie sens

OpenAI Deep Research

BLEU pozostaje historycznym punktem odniesienia, lecz słabo mierzy użyteczność swobodnych odpowiedzi modeli [OA]

Google Deep Think

Przestarzała metryka w erze modeli generatywnych, zupełnie nieprzydatna do oceny kreatywnego tekstu [G]

Related skills