AI Lab działający w Ośrodku Przetwarzania Informacji opracował i udostępnił model EuroDense. Służy on do wyszukiwania informacji w dziewięciu językach europejskich: polskim, angielskim, niemieckim, francuskim, hiszpańskim, włoskim, portugalskim, niderlandzkim oraz rosyjskim. Model ten został zaprojektowany z myślą o nowoczesnych wyszukiwarkach, systemach RAG (Retrieval Augmented Generation), chatbotach oraz asystentach AI, które wymagają skutecznego przeszukiwania dużych zbiorów dokumentów. EuroDense liczy 435 mln parametrów i obsługuje kontekst o długości do 8129 tokenów, aby mógł analizować dłuższe dokumenty. Na potrzeby jego treningu przygotowano korpus obejmujący ok. 200 mln tekstów. Modele typu dense retrevier mumożliwiają wyszukiwanie treści na podstawie ich znaczenia, a nie jedynie dopasowania słów kluczowych. EuroDense został udostępniony jako rozwiązanie open source na platformie Hugging Face.
Podziel się!