
2026 m. spalio 20 d. 15 val. kviečiame į seminarą Skaitmeninių tekstų rinkinio analizė įrankiu „Lexos“
Seminare bus pristatytas nemokamas viešos prieigos tekstinių duomenų analizės įrankis „Lexos“, sukurtas tarpdisciplininės humanitarinių mokslų ir informatikos specialistų grupės Lexomics Research Group. Pagrindinė įrankio idėja – tirti panašumus ir skirtumus. Šiuo įrankiu galima analizuoti ir vieną tekstą (skaidant į segmentus), bet dažniausiai analizuojami tekstų rinkiniai. Pavadinimas sufleruoja, kad juo tiriama tik leksika, bet iš tiesų yra daug funkcijų, kurių daugumą išbandysime per seminarą.
Naudojantis „Lexos“ galima lengvai parengti tekstus analizei (an. Scrub), pritaikyti savo atmetinių sąrašą (an. stopwords), išgauti tekstų žodžių ir jų dažnių sąrašą, žodžių debesis (tiek bendrą kolekcijai, tiek kiekvienam tekstui atskirai), automatiškai suskaidyti tekstą į lygias dalis. Taip pat atlikti sudėtingesnę analizę – nustatyti tekstų ar fragmentų panašumą, atlikti turinio analizę, identifikuoti būdingiausius žodžius (an. Top words) ir t. t. Įrankis yra parankus norintiems tirti ryšius tarp tekstų, arba to paties teksto fragmentų. Įrankio privalumas – galimybė pasirinkti iš daugiau kaip 10 panašumo matų (Euklido, Čebyšovo, Manheteno ir kt.).
Per seminarą atliksite parengtą užduotį su lietuviškų tekstų kolekcija, tačiau jei turite savo tekstų rinkinį, galėsite iškart naudoti aktualius, o ne užduočiai skirtus tekstus. Svarbiausias kriterijus – tekstų turi būti bent trys ir jie turi būti .txt formatu.
Planuojama trukmė: 1 valanda. Po jos iki pusvalandžio klausimams ir individualioms konsultacijoms, jeigu bus poreikis.
Glaustai:
Negalintys dalyvauti seminare, tačiau norintys išbandyti įrankį, daugiau informacijos ras čia >> https://wheatoncollege.edu/academics/special-projects-initiatives/lexomics/
Šį semestrą dar planuojame šiuos seminarus: