Predstavte si, že do stroja na mäso hodíte aj s igelitom. Tak nejako vyzerá, keď do AI natlačíte surové HTML dáta. Všade sú reklamy, menu, pätičky a "Prihláste sa do newslettera". To náš model učiť nechceme! Čistenie dát je asi 80 % práce a úprimne, je to tá najnudnejšia časť. Ale bez nej to proste nejde.
Najprv musím odstrániť všetky HTML tagy. Potom prichádza na rad regulárne výrazy (Regex) – to je taká čudná matematika na texty. Pomocou nich odstraňujem duplicitné vety a nezmyselné znaky. Zistil som, že veľa slovenských webov má chyby v kódovaní, takže namiesto "č" vidíte nejaké štvorčeky. Ak to neopravím, model bude generovať štvorčeky tiež!
"Kvalita dát je dôležitejšia ako ich kvantita. Radšej 1 GB čistého textu ako 10 GB odpadu s reklamami na chudnutie." – Moje zistenie po týždni trápenia.
Nakoniec robím deduplikáciu. Zistil som, že tie isté správy sú na desiatich rôznych weboch. Ak by sa ich model učil desaťkrát, začal by ich považovať za jedinú pravdu vesmíru. A to nechceme. Chceme variabilitu! Preto používam knižnice ako `datasketch` na hľadanie podobných textov.