Atlas · GenAI 2026
Speech Recognition
Turning speech into text — streaming vs batch, WER, noise and code-switching.
conceptPeak: 2023Audio & SpeechAI consensus: 3/3
Prerequisites
No prerequisites.
Recommended reference
Radford et al. (2023) "Robust Speech Recognition via Large-Scale Weak Supervision" — ICML (Whisper)
Notes from AI deep research
Anthropic Opus
Whisper przesunął ASR z usługi płatnej do wagi otwartej; próg wejścia runął
OpenAI Deep Research
Agenci głosowi uczynili opóźnienie, diaryzację i obsługę przełączania języków równie ważnymi jak WER [OA]
Google Deep Think
Interfejsy głosowe stają się domyślne w agentach AI, a kluczowe są modele działające strumieniowo [G]