Multimodalność
Multimodalność to zdolność modelu sztucznej inteligencji do przetwarzania i łączenia w spójny sposób wielu różnych typów danych, zwanych modalnościami — tekstu, obrazu, dźwięku, a nawet wideo. Model multimodalny nie ogranicza się do jednego kanału informacji, lecz potrafi zrozumieć relacje między nimi: opisać zawartość zdjęcia słowami, odpowiedzieć na pytanie dotyczące wykresu czy wygenerować obraz na podstawie polecenia tekstowego.
Na czym polega multimodalność?
W odróżnieniu od klasycznego modelu językowego, który operuje wyłącznie na tekście, model multimodalny rzutuje różne rodzaje danych na wspólną przestrzeń reprezentacji. Dzięki temu może wiązać ze sobą pojęcia niezależnie od tego, w jakiej formie zostały podane. Kluczowe cechy:
- Wspólna przestrzeń wektorowa — tekst i obraz są kodowane tak, by pojęcie „pies" miało zbliżoną reprezentację niezależnie od modalności.
- Elastyczne wejście i wyjście — polecenie może łączyć zdjęcie z pytaniem tekstowym, a odpowiedź przyjąć postać opisu lub wygenerowanej grafiki.
- Kontekst wielokanałowy — model rozumie treść pełniej, bo uwzględnia komplementarne sygnały, tak jak człowiek łączy wzrok, słuch i słowo.
Zastosowanie w praktyce
Multimodalność otwiera zastosowania niedostępne dla modeli jednokanałowych:
- Analiza obrazów — opisywanie zdjęć, odczytywanie tekstu z grafik i wspieranie dostępności cyfrowej.
- Asystenci głosowi i wizualni — łączenie mowy, obrazu z kamery i tekstu w jednej interakcji.
- Wyszukiwanie — multimodalne wyniki jak AI Overviews, które przetwarzają zapytania i treści w wielu formatach.
- Generowanie treści — tworzenie grafik, opisów produktów czy napisów na podstawie krótkiego promptu.
Trenowanie i serwowanie modeli multimodalnych jest zasobożerne — wymaga dużej mocy obliczeniowej i wielu akceleratorów GPU, co stawia wysokie wymagania wobec infrastruktury serwerowej i sieci o dużej przepustowości.
Powiązane pojęcia
Najczęstsze pytania
Czym różni się model multimodalny od klasycznego LLM?
Klasyczny model językowy przyjmuje i generuje wyłącznie tekst. Model multimodalny rozumie także obrazy, dźwięk czy wideo i potrafi łączyć te sygnały — np. opisać zdjęcie słowami albo odpowiedzieć na pytanie o wykres. Wejściem i wyjściem może być dowolna kombinacja modalności.
