Sreda. 24. jun 2020. u 18h, Studentski trg (Sala 718)
Jasmina Jovanović, Matematički fakultet, Univerzitet u Beogradu
Razvoj prediktora za klasifikovanje sekvenci
predlog prijave teme doktorske disertacije
Apstrakt
Ponavljajuće (repetitivne) sekvence (niske) predstavljaju delove sekvenci (podsekvence) koji se javljaju dva ili više puta. U zavisnosti od toga da li je podsekvenca kopije identična originalnoj, ili zajedno sa originalnom čini palindrom, ponovci mogu biti direktni ili obrnuti. Takođe ponovci mogu biti podeljeni u komplementarne i nekomplementarne ponovke u zavisnosti od toga da li ispunjavaju funkciju preslikavanja svih karaktera u njihove komplementarne karaktere. Statistički značajni ponovci predstavljaju podskup ponovaka sekvence za koje nije očekivano da će se pojaviti u nasumičnoj sekvenci iste dužine.
Biološki makromolekuli polimerne prirode (DNK, RNK, proteini) se mogu posmatrati kao niske karaktera. DNK se može predstaviti kao niska karaktera nad azbukom A = {A, C, G, T}, dok se aminokiselinska niska može posmatrati kao niska karaktera nad 20-oslovnom azbukom sačinjenom od oznaka amino kiselina. Dužina nukleotidnih sekvenci varira od nekoliko nukleotida do više stotina miliona nukleotida, dok dužina aminokiselinksih sekvenci varira od nekoliko desetina do više hiljada aminokiselina. Analiza sličnosti nukleotidnih i proteinskih sekvenci je važna u određivanju funkcionalnih, strukturnih i evolucionih odnosa između različitih taksonomskih kategorija i/ili drugih karakteristika organizama. Njena značajnost se takođe ogleda u određivanju kategorija novootkrivenih sekvenci, poređenjem sa sekvencama koje imaju poznate funkcije. Ove analize su najčešće korišćene i primenjivane u bioinformatici. Postoje različiti algoritmi za poređenje sekvenci, koji se mogu podeliti na algoritme zasnovane na poravnanju (globalna i lokalna poravnanja) ili bez poravnanja sekvenci. Takođe se mogu klasifikovati na metode za poravnanje parova (dve sekvence) i za višestruko poravnanje (sa više od dve sekvence). Više algoritama koje koriste tehnike dinamičkog programiranja (kao što su Needleman-Wunsch i Smith-Waterman), kao i heuristički algoritmi (FASTA, BLAST i ClustalW) su uspešno razvijeni u cilju rešavanja problema poravnanja sekvenci i analize sličnosti, koji se mogu, pored nukleotidnih i proteinskih, primeniti i na druge sekvence (na primer u lingvistici za analizu prirodnih jezika).
Do sada razvijeni i korišćeni algoritmi nisu zasnovani na različitim tipovima statistički značajnih ponovaka varijabilnih dužina. Predmet ove disertacije biće analiza nukleotidnih i proteinskih sekvenci i njihovih ponovaka u cilju razvoja novih modela za identifikovanje sličnosti sekvenci na osnovu izabranih ponovaka. Klasifikacija (do sada neklasifikovanih) ulaznih sekvenci bi se vršila formiranjem njihovih profila na osnovu ponovaka i poređenjem sa bazom profila sekvenci koje imaju poznate karakteristike. U formiranju klasifikacionog modela za identifikaciju sličnosti sekvenci biće korišćene metode istraživanja podataka (klasifikacija, klasterovanje i analiza teksta) na osnovu kojih će se omogućiti provera preciznosti dobijenih rezultata.
