Atlas · GenAI 2026

Speech Recognition

Turning speech into text — streaming vs batch, WER, noise and code-switching.

conceptPeak: 2023Audio & SpeechAI consensus: 3/3

Prerequisites

No prerequisites.

Recommended reference

Radford et al. (2023) "Robust Speech Recognition via Large-Scale Weak Supervision" — ICML (Whisper)

Notes from AI deep research

Anthropic Opus

Whisper przesunął ASR z usługi płatnej do wagi otwartej; próg wejścia runął

OpenAI Deep Research

Agenci głosowi uczynili opóźnienie, diaryzację i obsługę przełączania języków równie ważnymi jak WER [OA]

Google Deep Think

Interfejsy głosowe stają się domyślne w agentach AI, a kluczowe są modele działające strumieniowo [G]

Related skills