– Modele językowe sztucznej inteligencji są przede wszystkim anglocentryczne.
Rozwijają je więc państwa anglosaskie, które skupiają się na najlepszym działaniu w domenie języka angielskiego, natomiast w innych językach są mniej skuteczne, na przykład francuskim, niemieckim czy hiszpańskim. Naszym celem przy budowaniu EuroDense było wypełnienie tej luki, aby powstał model, który w zakresie języków kontynentalnych miał jakość modeli anglocentrycznych – podkreśla w rozmowie z agencją Newseria dr inż. Marek Kozłowski, kierownik AI Lab OPI-PIB.
Model EuroDense przeznaczony jest do wyszukiwania informacji w dziewięciu językach
Modele sztucznej inteligencji są nadal znacznie lepiej dostosowane do języka angielskiego niż do wielu języków europejskich. EuroDense, czyli model opracowany przez OPI-PIB, który specjalizuje się w wyszukiwaniu informacji, ma pomóc zmniejszyć tę lukę. Obsługuje dziewięć europejskich języków, a w siedmiu z nich osiąga lepsze wyniki niż inne modele wielojęzyczne porównywalnej wielkości. Rozwiązanie powstało w ramach europejskiego projektu LLMs4EU i ma wspierać wdrażanie lokalnych narzędzi AI m.in. w administracji, energetyce czy telekomunikacji.
AI Lab działający w Ośrodku Przetwarzania Informacji (OPI) opracował i udostępnił model EuroDense, przeznaczony do wyszukiwania informacji w dziewięciu językach. To pierwsze wielojęzyczne rozwiązanie tego typu stworzone przez zespół badawczy OPI. Model został zaprojektowany z myślą o wyszukiwarkach, systemach RAG (Retrieval Augmented Generation), chatbotach oraz asystentach AI, które wymagają skutecznego przeszukiwania dużych zbiorów dokumentów.
We wszystkich językach, poza portugalskim i angielskim, przebija wszystkie inne modele porównywalnej wielkości, które były do tej pory znane
– Model EuroDense obsługuje dziewięć języków: niemiecki, francuski, hiszpański, portugalski, włoski, holenderski, rosyjski, angielski i polski. We wszystkich językach, poza portugalskim i angielskim, przebija wszystkie inne modele porównywalnej wielkości, które były do tej pory znane, inne modele multijęzyczne amerykańskie czy chińskie – podkreśla Marek Kozłowski. EuroDense jest modelem typu dense retriever, czyli narzędziem, które wyszukuje informacje na podstawie znaczenia treści, a nie tylko dopasowania słów kluczowych. Liczy 435 mln parametrów, a do jego treningu wykorzystano wielojęzyczny korpus obejmujący ok. 200 mln tekstów.
– EuroDense powstał w ramach projektu LLMs4EU, inicjatywy Unii Europejskiej, której celem jest stworzenie koalicji na rzecz rozwoju technologii językowych w UE. Projekt jest współfinansowany przez Unię oraz Ministerstwo Cyfryzacji. Jego celem jest walka z luką kompetencyjną i tworzenie rozwiązań LLM-owych na rzecz UE – tłumaczy kierownik AI Lab OPI-PIB.
Obecnie wdrażanie LLM-ów to nie jest tylko postawienie LLM-a, jak ChatGPT, ale budowanie wokół niego wielu usług
LLMs4EU jest częścią szerszych działań Unii na rzecz rozwoju własnych modeli językowych. Jedną z barier jest niedobór danych w językach europejskich potrzebnych do trenowania LLM-ów. UE rozwija w tym obszarze m.in. Alliance for Language Technologies (ALT-EDIC) oraz European Language Data Space (LDS). Ten ostatni ma zwiększyć dostępność wielojęzycznych danych oraz ułatwić ich gromadzenie, wymianę i ponowne wykorzystanie na potrzeby rozwoju europejskich modeli AI.
– Obecnie wdrażanie LLM-ów to nie jest tylko postawienie LLM-a, jak ChatGPT, ale budowanie wokół niego wielu usług. Teraz najpopularniejsze są wdrożenia typu RAG, gdzie mamy wyszukiwarkę na naszej lokalnej bazie i dopiero te informacje przepływają do LLM-a, który na ich podstawie podejmuje decyzje lub generuje odpowiedź w języku naturalnym. Dlatego nie tylko stworzenie samego LLM-a, ale też budowa wokół niego narzędzi, które będą go wspierały, gwarantuje nam skuteczne wdrożenie w Unii Europejskiej czy w krajach członkowskich różnych rozwiązań – przekonuje Kozłowski.