Getty Images

RoLlama: A fost lansat primul model de limbaj dedicat limbii române pentru AI-ul generativ5 min read

De Ionuț Preda 17.05.2024

AI-ul generativ devine specializat pe limba română, în urma unui proiect derulat în comun de două universități mari din Capitală.

O echipă de cercetători români a anunțat crearea unui prim model de limbaj (LLM) pentru AI generativ dedicat limbii române, în cadrul inițiativei OpenLLM-Ro. Inițiatorii au lansat și o platformă cu același nume, destinată dezvoltării open source a tehnologiilor AI pentru limba română.

Proiectul este dezvoltat de către Universitatea Politehnică din București și Institutul de Logica și Știința Datelor (Universitatea din București), cu sprijinul BRD Groupe Société Générale. Primul model lansat în cadrul acestuia, RoLlama, este dezvoltat în regim open source, iar cea mai recentă variantă este disponibilă gratuit pe platforma Hugging Face.// Detalii pe huggingface.co //

Chiar dacă multe din modelele de limbaj folosite în AI-urile conversaționale populare pot genera răspunsuri în limba română, dezvoltatorii acestora se concentrează în principal pe antrenarea modelelor în limba engleză. În consecință, atunci când sunt folosite în limba română, există șanse mari ca acestea să ofere răspunsuri bizare când generează text sau rezultate inexacte atunci când sunt folosite pentru a căuta informații.

Soluția constă în antrenarea unui model de limbaj specific pe baze de date cu cantități mari de articole, postări de social media, cărți digitale, crawluri și alte tipuri de texte digitale în limba română. Pe acest principiu se bazează modelul RoLlama, care este o variantă adaptată al LLM-ului open source Llama 2 dezvoltat de către Meta. Acesta a fost antrenat pe seturi de date// „LLM for Romanian: Pre-training and fine-tuning of Large Language Models to obtain a foundation model for the Romanian language”, ilds.ro // cu peste 40 de milioane de documente în limba română și 2,3 milioane de instrucțiuni și conversații traduse în limba română.

„Câteva dintre exemplele de utilizare ale modelului românesc sunt: căutarea de informații în baza de cunoștințe a unei organizații, cu ghiduri și proceduri de lucru, sau roboți conversaționali pentru clienții companiilor sau ai instituțiilor, care să îi ghideze în parcurgerea pașilor necesari pentru utilizarea unui produs sau serviciu. În ambele cazuri, angajații și/sau clienții economisesc timp în accesarea informației, beneficiind în multe situații și de îmbunătățirea calității acesteia”, explică Alin Ștefănescu, directorul Departamentului de Informatică din cadrul Universității din București și vicepreședintele Institutului de Logică și Știința Datelor.

Totodată, cercetătorii au mai dezvoltat un model specializat în limba română pe baza unui alt LLM disponibil open-source, Mistral, și au anunțat că urmăresc dezvoltarea unor iterații pe baza acestuia sau a versiunii mai recente a LLM-ului de la Meta, Llama 3, care sunt mai performante decât cel folosit ca bază pentru modelul actual. În acest sens, comunitatea OpenLLM-Ro,// Detalii pe huggingface.co // construită în jurul proiectului, țintește să adune la un loc modele similare specializate pe limba română și să faciliteze dezvoltarea acestora și a altor tehnologii AI în regim open-source.



Text de

Ionuț Preda

Redactor cu câțiva ani de experiență în presa centrală. Este curios despre aplicarea tehnologiilor SF în lumea reală și evoluția ideilor de-a lungul istoriei.

ȘTIINȚĂ|FYI

Macacii recunosc asocieri de cuvinte, la fel ca oamenii

De
Macacii pot asocia cuvinte cu imagini, o abilitate considerată mult timp exclusiv umană, arată o cercetare recentă. 
MEDIU|FYI

România riscă sancțiuni din partea Comisiei Europene pentru că nu aplică corect regulile privind plasticul de unică folosință

De
Comisia Europeană a deschis o procedură de infringement împotriva României. Țara nu a transpus corect Directiva privind plasticul de unică folosință. Unele produse interzise sunt încă permise, iar producătorii nu acoperă toate costurile. Lipsesc și măsuri pentru alternative sustenabile. România are două luni să rezolve problemele, altfel riscă sancțiuni.
MEDIU|FYI

Jurnale vechi de 500 de ani arată cum a schimbat Mica Eră Glaciară viața în Transilvania

De
Documente istorice din Transilvania arată cum a influențat vremea extremă viața oamenilor în urmă cu 500 de ani. Perioade de secetă severă, inundații și frig extrem au dus la foamete, epidemii și schimbări în așezările umane.
MEDIU|FYI

Raport: România are una dintre cele mai slabe rețele de transport din UE. Cum afectează asta economia?

De
România se confruntă cu o problemă gravă de inegalitate în accesul la transport, care afectează milioane de oameni, în special în mediul rural și în regiunile slab conectate la rețeaua națională.