Przejdź do zawartości

Lyra (kodek)

Z Wikipedii, wolnej encyklopedii
Lyra
Autor Google
Pierwsze wydanie 2021
Aktualna wersja stabilna 1.3.2 (20 grudnia 2022) [1]
Rodzaj kodek dźwięku
Licencja Apache-2.0
Strona internetowa
Porównanie jakości mowy z Lyra w wersji 1

Lyra – stratny kodek dźwięku opracowany przez Google, przeznaczony do kompresji mowy przy bardzo niskich przepływnościach. W odróżnieniu od większości innych formatów audio kompresuje dane, wykorzystując algorytm oparty na uczeniu maszynowym.

Kodek Lyra jest przeznaczony do przesyłania mowy w czasie rzeczywistym, gdy przepustowość jest poważnie ograniczona, np. w przypadku wolnych lub zawodnych połączeń sieciowych[2].

Działa przy stałych przepływnościach bitowych 3,2 kbit/s, 6 kbit/s oraz 9 kbit/s i ma zapewniać lepszą jakość niż kodeki wykorzystujące tradycyjne algorytmy oparte na kształcie fali przy podobnych szybkościach transmisji[3][1].

Zamiast tego kompresję uzyskuje się za pomocą algorytmu uczenia maszynowego, który koduje dane wejściowe za pomocą ekstrakcji cech, a następnie rekonstruuje przybliżenie oryginału przy użyciu modelu generatywnego[3].

Model ten wytrenowano na tysiącach godzin nagrań mowy w ponad 70 językach, aby umożliwić jego współpracę z różnymi osobami mówiącymi[3]. Ponieważ modele generatywne wymagają większej złożoności obliczeniowej niż tradycyjne kodeki, w celu uzyskania akceptowalnej wydajności stosuje się prosty model, który przetwarza różne zakresy częstotliwości równolegle[4].

Lyra nakłada 20 ms opóźnienia ze względu na rozmiar ramki[3].

Referencyjna implementacja Google jest dostępna na systemy Android i Linux[4].

Jakość

[edytuj | edytuj kod]

Początkowa wersja Lyry działała znacznie lepiej niż tradycyjne kodeki przy podobnych szybkościach transmisji[3][1].

Ian Buckley z MakeUseOf powiedział: „Udaje mu się tworzyć niemal niesamowite poziomy reprodukcji dźwięku przy szybkości transmisji bitów wynoszącej zaledwie 3 kbps.” Google twierdzi, że odtwarza naturalnie brzmiącą mowę, a Lyra przy 3 kbit/s pokonuje Opus 8 kbit/s.[4]

Tsahi Levent-Levi pisze, że Satin, kodek Microsoftu oparty na sztucznej inteligencji, przewyższa go przy wyższych szybkościach transmisji bitów[1].

Przypisy

[edytuj | edytuj kod]
  1. 1 2 3 4 Google Open Source Blog: Lyra V2 – a better, faster, and more versatile speech codec. [dostęp 2025-06-02].
  2. MakeUseOf: Google Makes Its Lyra Low Bitrate Speech Codec Public. [dostęp 2025-06-02].
  3. 1 2 3 4 5 Google AI Blog. 25 February 2021: Lyra: A New Very Low-Bitrate Codec for Speech Compression. [dostęp 2025-06-02].
  4. 1 2 3 XDA: Google Duo uses a new codec for better call quality over poor connections. [dostęp 2025-06-02].

Linki zewnętrzne

[edytuj | edytuj kod]