Kaip pradėti naudoti NLG ataskaitoms
Žingsnis po žingsnio vadovas pradedantiesiems. Suprasite pagrindinius konceptus ir kaip nustatyti savo pirmą NLG sistemą.
Skaityti daugiauSvarbiausias žingsnis — teisingai suformatuoti duomenis. Čia rasite praktinius patarimus apie duomenų valymą ir struktūrizavimą.
Natūralios kalbos generavimo sistemos yra tokios galingos, kiek galingi jų duomenys. Jei į sistemą įvedate šiukšles — iš jos išeina šiukšles. Tai nėra pasikalbėjimas apie "garbage in, garbage out" frazę, tai realybė, su kuria dirba kiekvienas, kuris kada nors bandė automatizuoti ataskaitų kūrimą.
Duomenų paruošimas yra žingsnis, kuriame dažniausiai suklupstama. Dauguma žmonių nori iš karto pradėti su mašinų mokymu ir algoritmais, bet jei jūsų duomenys nešvarūs, neišbalansuoti arba netinkamai struktūrizuoti, net pats geriausias algoritmas nepavels jums puikių rezultatų. Štai kodėl šiam procesui reikia skirtis atidžia ir sisteminė prieiga.
Šis procesas nėra sudėtingas, bet reikalinga dėmesys kiekvienam etapui.
Pirmas žingsnis — nustatyti ir pašalinti klaidingus, neišbalansuotus ir pasikartojančius įrašus. Tai reiškia duplikatų šalinimą, nulių reikšmių tvarkymas ir standartizavimą. Jei jūs dirbate su finansiniais duomenimis, turėsite patikrinti skaičius, datas ir valiutas.
Keičiame duomenis į formatą, kurį gali suprasti NLG sistema. Tai reiškia skaitinių verčių normalizavimą, kategorijų kodavimą ir laiko serijų transformavimą. Paprastai naudojame Min-Max normalizavimą arba Z-score metodą.
Prieš naudojant duomenis, reikalinga juos patikrinti. Ar jie atitinka laukiamas reikšmių ribas? Ar nėra nenumatytų šaltinių? Šis žingsnis padeda išvengti baisių ataskaitų, kurias sukuria sistema remiantis klaidingais duomenimis.
Užrašykite, ką darėte. Kokius filtrus pritaikėte? Kokias transformacijas naudojote? Kodėl? Šis dokumentavimas yra nepamainomas, kai ataskaitai pradeda atrodyti keistai ir reikia suprasti, kur suklydote.
Štai keletas konkretūs metodų, kuriuos galite naudoti šiandien.
Jei naudojate Excel arba SQL, duplikatai dažnai atsiranda dėl kelių šaltinių arba duomenų importavimo klaidų. Visada patikrinkite, ar jūs nepraradote kritinių įrašų šalinant duplikatus. Jei duomenys turi sudėtinę raktą (pvz., data + kliento ID), naudokite DISTINCT arba panašias funkcijas.
Turite tris parinktis: šalinti eilutes su nuliais (jei jų mažai), užpildyti vidurkiu arba medianą (jei duomenys yra skaitiniai), arba naudoti prognozavimą. Jei nuliai sudaro daugiau nei 30 proc. stulpelio, tai gali būti ženklas, kad duomenys nėra iš patikimo šaltinio.
Jei turite duomenis skirtingose skalėse (pvz., vienas stulpelis 0–100, kitas 0–1 milijonas), NLG sistema gali neproporcingai pabrėžti didesnes reikšmes. Normalizuokite duomenis į 0–1 diapazoną arba standartizuokite naudodami Z-score.
Jums nereikia išleisti tūkstančius eurų. Šie įrankiai yra prieinami ir efektyvūs.
Pradžioje šitai yra viskas, ko jums reikia. VLOOKUP, FILTER ir Data Validation yra pakankami mažiems duomenų rinkiniams. Nemokama ir intuityvus.
Jei turite šiek tiek daugiau duomenų ir žinote, kaip rašyti kodą, Pandas biblioteka yra negrąžintina. Jūs galite valgyti, transformuoti ir analizuoti duomenis keliose eilutėse kodo.
PostgreSQL arba MySQL yra geri pasirinkimai struktūrizuotiems duomenims. Galite tiesiogiai rašyti SQL užklausas duomenų valymui ir transformavimui prieš jas išduodami NLG sistemai.
Jei naudojate grafines sąsajas ir norite matyti, ką darote, OpenRefine yra puikus. Geras duomenų valymui ir deduplicavimui be programavimo.
Autorius
Redakcinė Komanda
ReportAI redakcinė komanda, skirta praktiškai ir suprantamai pristatyti natūralios kalbos generavimą ketvirčio ataskaitoms.
Šis vadovas yra informacinis išteklius apie duomenų paruošimo praktikas natūralios kalbos generavimo sistemoms. Konkretūs jūsų situacijos rezultatai gali skirtis atsižvelgiant į jūsų duomenų pobūdį, sistemos konfigūraciją ir konkretūs naudoti įrankiai. Visada rekomenduojame testuoti duomenų transformacijas su mažais duomenų rinkiniais prieš juos taikant didiesiems. Jei dirbate su jautriu verslo duomenimis, konsultuokitės su duomenų saugos specialistu.
Duomenų paruošimas nėra seksi. Tai nėra mašinų mokymas arba dirbtinis intelektas. Bet tai yra šios dalies raktą, ir jei jūs tai padarysite teisingai, visa likusi sistema išlaidos yra daug lengviau. Pradėkite nuo paprasto: identifikuokite klaidingus duomenis, šalinkite duplikatus, normalizuokite skalę. Tada judėkite į sudėtingesnias transformacijas.
Kita mūsų ataskaitų serija bus apie kokybės patikrinimą ir peržiūrą — kaip suprasti, ar jūsų NLG sistema iš tikrųjų veikia teisingai. Likusime susisiekę.
Norite sužinoti daugiau apie NLG ataskaitų kokybės patikrinimą?
Skaitykite kitą vadovą
Žingsnis po žingsnio vadovas pradedantiesiems. Suprasite pagrindinius konceptus ir kaip nustatyti savo pirmą NLG sistemą.
Skaityti daugiau
Automatizuota generavimo sistema nesukuria tobulų rezultatų iš karto. Išmokite, kaip greitai nustatyti ir ištaisyti problemas.
Skaityti daugiau
Kaip suderinti automatizuotą ataskaitų generavimą su egzistuojančiais darbo procesais ir sistemomis.
Skaityti daugiau