Despre proiect
Scopul proiectului ADAMo este de a dezvolta un clasificator de texte capabil să identifice conținutul generat de inteligența artificială (IA). Deși vor fi utilizate trăsături lingvistice specifice limbii, soluția finală va fi una independentă de limbă. Având în vedere existența unor resurse similare în alte limbi, noile modele neuronale pot fi antrenate pentru a detecta texte generate de IA și în alte limbi.
Vom folosi corpusul reprezentativ al limbii române contemporane (CoRoLa), care conține peste 1 miliard de cuvinte (din texte scrise și vorbite), ca sursă principală de date pentru antrenarea clasificatorului. Pentru a reflecta varietățile lingvistice din România și Republica Moldova, CoRoLa va fi extins cu cel puțin 15 milioane de tokeni proveniți din texte de înaltă calitate din Republica Moldova, cu drepturi de autor clarificate, respectând principiile originale de selecție a datelor, structurarea metadatelor și nivelurile de adnotare. Întregul corpus va fi procesat și cu un parser sintactic, pentru a surprinde asemănările și diferențele de la mai multe niveluri lingvistice, devenind astfel o resursă valoroasă pentru studiul celor două varietăți ale limbii române.
Clasificator IA
Dezvoltarea unui sistem avansat pentru detectarea textelor generate artificial
Independență lingvistică
Soluție adaptabilă pentru mai multe limbi și contexte
Extinderea CoRoLa
Adăugarea a 15 milioane de cuvinte din texte moldovenești de calitate
Resurse și metodologie
Corpusul CoRoLa
Peste 1 miliard de cuvinte din texte contemporane românești, scrise și vorbite
Extensie moldovenească
Minimum 15 milioane de cuvinte din texte autorizate, de înaltă calitate
Analiză sintactică
Procesare automată pentru identificarea similarităților și diferențelor lingvistice
Antrenarea modelului
Dezvoltarea de modele neuronale pentru detectarea textelor generate de inteligența artificială
Varietăți lingvistice
România și Republica Moldova
Pentru a surprinde varietățile lingvistice din România și Republica Moldova, întregul corpus va fi supus unei analize sintactice automate, cu scopul de a evidenția asemănările și diferențele la multiple niveluri lingvistice.
Aceasta va constitui o resursă valoroasă pentru studiul celor două varietăți ale limbii române și pentru înțelegerea nuanțelor specifice fiecărei regiuni.
Parteneri strategici
Rezultate științifice
Conferință internațională
Detectarea automată a textelor generate de inteligență artificială din Republica Moldova și România (ADAMo) – prezentare de proiect.
Prezentat în cadrul celei de-a XX-a Conferințe Internaționale privind Resursele Lingvistice și Instrumentele pentru Procesarea Limbajului Natural
Echipa I.C.I.A.

Dr. Verginica BARBU MITITELU
Cercetător științific principal Ggradul II

Dr. Vasile Florian PĂIȘ
Cercetător științific
Gradul II

Dr. Elena IRIMIA
Cercetător științific
Gradul III

Dr. Radu ION
Cercetător științific
Gradul II

Dr. Tiberiu BOROȘ
Cercetător științific
Gradul II

Dr. Maria CARP
Cercetător științific
Gradul II

Sergiu Nisioi
Conferențiar universitar

Eric CUREA
Cercetător științific
Gradul III
Echipa U.T.M.

Dr. Victoria Bobicev
Lector universitar (titular), Cercetător științific (cumul de funcții)

Olesea Caftanatov
Șef de laborator

Dr. Daniela Istrati
Lector universitar (titular)

PhD. Stud. Rodica Braniște
Lector universitar

Victoria Alexei
Lector universitar

Alexandr Parahonco
Cercetător științific

Ludmila Malahov
Cercetător științific
Contact
Coordonator principal
Verginica Barbu Mititelu
Institutul de Cercetări pentru Inteligență Artificială „Mihai Drăgănescu”
