Nodea — logo

Multimodalność

Multimodalność to zdolność modelu sztucznej inteligencji do przetwarzania i łączenia w spójny sposób wielu różnych typów danych, zwanych modalnościami — tekstu, obrazu, dźwięku, a nawet wideo. Model multimodalny nie ogranicza się do jednego kanału informacji, lecz potrafi zrozumieć relacje między nimi: opisać zawartość zdjęcia słowami, odpowiedzieć na pytanie dotyczące wykresu czy wygenerować obraz na podstawie polecenia tekstowego.

Na czym polega multimodalność?

W odróżnieniu od klasycznego modelu językowego, który operuje wyłącznie na tekście, model multimodalny rzutuje różne rodzaje danych na wspólną przestrzeń reprezentacji. Dzięki temu może wiązać ze sobą pojęcia niezależnie od tego, w jakiej formie zostały podane. Kluczowe cechy:

  • Wspólna przestrzeń wektorowa — tekst i obraz są kodowane tak, by pojęcie „pies" miało zbliżoną reprezentację niezależnie od modalności.
  • Elastyczne wejście i wyjście — polecenie może łączyć zdjęcie z pytaniem tekstowym, a odpowiedź przyjąć postać opisu lub wygenerowanej grafiki.
  • Kontekst wielokanałowy — model rozumie treść pełniej, bo uwzględnia komplementarne sygnały, tak jak człowiek łączy wzrok, słuch i słowo.

Zastosowanie w praktyce

Multimodalność otwiera zastosowania niedostępne dla modeli jednokanałowych:

  1. Analiza obrazów — opisywanie zdjęć, odczytywanie tekstu z grafik i wspieranie dostępności cyfrowej.
  2. Asystenci głosowi i wizualni — łączenie mowy, obrazu z kamery i tekstu w jednej interakcji.
  3. Wyszukiwanie — multimodalne wyniki jak AI Overviews, które przetwarzają zapytania i treści w wielu formatach.
  4. Generowanie treści — tworzenie grafik, opisów produktów czy napisów na podstawie krótkiego promptu.

Trenowanie i serwowanie modeli multimodalnych jest zasobożerne — wymaga dużej mocy obliczeniowej i wielu akceleratorów GPU, co stawia wysokie wymagania wobec infrastruktury serwerowej i sieci o dużej przepustowości.

Powiązane pojęcia

Najczęstsze pytania

Czym różni się model multimodalny od klasycznego LLM?

Klasyczny model językowy przyjmuje i generuje wyłącznie tekst. Model multimodalny rozumie także obrazy, dźwięk czy wideo i potrafi łączyć te sygnały — np. opisać zdjęcie słowami albo odpowiedzieć na pytanie o wykres. Wejściem i wyjściem może być dowolna kombinacja modalności.