AI turvalisus: milliseid andmeid ei tohiks tehisintellektiga jagada?

AI turvalisus: milliseid andmeid ei tohiks tehisintellektiga jagada?
Sisukord

Tarbijatele mõeldud keelemudelite kasutamisel on oluline hoolikalt jälgida, milliseid andmeid neisse sisestada: avalikesse AI-tööriistadesse saadetud teave lahkub kasutaja kohalikust keskkonnast. Konfidentsiaalsete andmete sisestamisega kaasneb andmelekke, ärisaladuse avalikustamise ja isikuandmete kaitse nõuete rikkumise oht. Seetõttu tasub igasse sellisesse suhtlusse suhtuda nii, nagu avaldataks teave kõigile.

Mida ei tohiks AI-tööriistadesse sisestada?

Avalikult kättesaadavatesse mudelitesse ei tohi sisestada järgmisi andmeid:

  • isikuandmed – klientide, töötajate või enda ees- ja perekonnanimed, aadressid, isikukoodid, telefoninumbrid ning e-posti aadressid;
  • meditsiiniandmed – haiguslood, uuringutulemused ja patsientide diagnoosid, mille suhtes kehtivad ranged õiguslikud nõuded (nt GDPR või HIPAA);
  • ettevõtte konfidentsiaalne teave – avaldamata finantsaruanded, turundusstrateegiad, kliendiandmebaasid ning ühinemis-, omandamis- või koondamisplaanid;
  • ärisaladused – tarkvara lähtekood, tootmisretseptid, ainulaadsed algoritmid ja ettevõtte sisemine tehniline dokumentatsioon;
  • salajased juurdepääsuandmed – paroolid, API-võtmed, sisselogimisandmed, autentimistokenid, maksekaardiandmed ja krüptovõtmed;
  • autoriõigusega kaitstud materjalid – raamatute, tasuliste teadusartiklite või õppematerjalide terviktekstid, mille kasutamiseks puudub vajalik luba;
  • ebaseaduslik sisu – vägivalda või vaenu õhutavad materjalid ning juhised kehtiva õigusega vastuolus olevaks tegevuseks.

Mis juhtub tehisintellektile sisestatud andmetega?

Pilveteenuse pakkujale saadetud andmeid töödeldakse ja analüüsitakse mitmes etapis. Nende kasutus ei piirdu üksnes vastuse koostamisega.

Mudelite treenimine

Tarbijatele mõeldud generatiivsete tööriistade tavaversioonidesse sisestatud andmeid kasutatakse sageli mudelite edasiseks treenimiseks. See tähendab, et sisestatud teave võib mõjutada närvivõrgu parameetreid ja teoreetiliselt ilmuda tulevikus mõne teise kasutaja vastuses.

Inimülevaatus ja modereerimine

Lisaks automaatsele töötlemisele kasutavad AI-süsteemid turvafiltreid. Kui algoritm peab päringut kahtlaseks (näiteks kasutustingimusi rikkuvaks), võidakse vestlus märgistada ja suunata inimülevaatusele. Seega võivad teenusepakkuja töötajad või välised andmete märgendajad näha sisestatud sisu, et modereerimissüsteeme täiustada.

Andmete säilitamine ja varukoopiad

AI-teenuse pakkujad hoiavad vestlusi oma serverites teenuse toimimise, vigade diagnoosimise ja tulevaste vestluste konteksti säilitamise eesmärgil. Oluline on teada, et vestluse kustutamine kasutajaliideses ei tähenda enamasti andmete viivitamatut eemaldamist serveritest. Teave võib jääda teenusepakkuja varukoopiatesse kindlaks ajaks, suurendades konfidentsiaalsete andmete avalikuks tuleku ohtu, kui pilvetaristu satub eduka küberrünnaku alla.

Erakontod ja ettevõttekontod: mille poolest andmekaitse erineb?

AI-tööriistade andmekaitse sõltub suuresti tellimuse tüübist ja teenuse kasutuselevõtu viisist.

Tasuta ja tasuliste tavapäraste erakontode puhul kasutatakse paljudes populaarsetes teenustes sisestatud teavet vaikimisi mudelite treenimiseks. Kui sellises vestluses jagatakse konfidentsiaalset materjali, kaasneb iga kasutuskorraga selle kontrollimatu avalikuks tuleku oht.

Ettevõtte- ja suurorganisatsioonidele mõeldud keskkondades (näiteks Enterprise-kontod ning teenused, mida kasutatakse privaatses pilves selliste pakkujate API kaudu nagu Microsoft Azure, AWS või Google Cloud) on kaitsenõuded rangemad. Teenusepakkujad tagavad vastavuse turvastandarditele (ISO 27001, SOC 2, GDPR) ning kinnitavad lepingutes (SLA/DPA), et kliendiandmeid ei kasutata avalike baasmudelite treenimiseks. Sellistes keskkondades võivad sisestatavate andmete piirangud olla leebemad, kuid riskijuhtimise ja juurdepääsukontrolli põhimõtted on endiselt vajalikud.

Mida võib AI-tööriistadesse ohutult sisestada?

Piirangutest hoolimata leidub palju teavet, mida saab AI-tööriistadesse sisestada ja seal töödelda. Näiteks:

  • avalikult kättesaadavad materjalid – avatud allikates avaldatud artiklid, blogipostitused, avalikud turuaruanded, õigusaktid ja veebilehtede sisu (näiteks Vikipeediast);
  • mittekonfidentsiaalne teave – üldised juhised, küsimused teoreetiliste mõistete kohta, grammatika- ja õigekirjareeglid, matemaatilised võrrandid ning sõnade tähendust puudutavad päringud;
  • anonüümitud dokumendikatked – kirjade mallid, lepingupõhjad või koodilõigud, millest on täielikult eemaldatud ainulaadsed muutujad, võtmed, klientide nimed ja sisearhitektuuri üksikasjad;
  • enda loodud tekstid – e-kirjade mustandid, sotsiaalmeediapostitused, esitluskavad või artiklid, mis ei sisalda tundlikke äriandmeid;
  • avatud andmestikud – sünteetilised andmed või avalikest andmehoidlatest pärit statistika, mida kasutatakse analüüsi ja vormindamise harjutamiseks.

Kuidas sõnumeid ja andmeid enne AI-tööriista saatmist tõhusalt anonüümida?

Enne konfidentsiaalsete dokumentide keelemudelisse saatmist tuleb need ette valmistada ja tundlikust teabest puhastada. Nii saab tekstiga töötada, vähendades konfidentsiaalsete andmete avalikuks tuleku ohtu.

Identifikaatorite eemaldamine ja tokeniseerimine

Tokeniseerimisel asendatakse tundlikud andmed väljamõeldud vastetega. Näiteks võib nime „Mari Tamm” asendada tähisega “[Klient_1]” ja ettevõtte nime „Näidis OÜ” tähisega „[Organisatsioon_A]”. Nii säilivad keelemudeli jaoks dokumendi struktuur, lauseehitus ja kontekst, ilma et algset isikut või ettevõtet saaks nime järgi tuvastada.

Tundliku teabe maskeerimine

Maskeerimine tähendab oluliste märgijadade otsest peitmist, tavaliselt nende asendamist erimärkidega (näiteks kaardinumber 4532 **** **** ****). Teine tõhus võte on andmete üldistamine: täpse väärtuse (näiteks töötasu 3 200 EUR) asemel kasutatakse vahemikku või üldistust (näiteks „töötasu vahemikus 3 000–4 000 EUR”). See vähendab uuesti tuvastamise ohtu.

Protsessi automatiseerimine (DLP ja RegEx)

Pikkadest tekstidest käsitsi andmeid eemaldades võib midagi märkamata jääda. Töökeskkondades kasutatakse regulaaravaldistel (RegEx) põhinevaid skripte või DLP-süsteeme (Data Loss Prevention ehk andmekao vältimine). Need tööriistad saavad päringu enne saatmist automaatselt läbi vaadata ning tuvastada ja blokeerida või asendada märgijadasid, mis vastavad isikukoodide, käibemaksukohustuslase registreerimisnumbrite, e-posti aadresside või pangakontonumbrite vormingule.

AI-ga jagatav teave: kuidas keelata oma andmete kasutamine mudelite treenimiseks?

AI-tööriistadesse sisestamisega seotud riski saab vähendada ka tööriista seadeid muutes. Enamik teenusepakkujaid võimaldab loobuda oma sisu kasutamisest mudelite treenimiseks.

  • ChatGPT (OpenAI) – konto menüüs Settings, jaotises Data controls, on valik Improve the model for everyone. Selle väljalülitamine peatab sisestatud tekstide kasutamise mudeli treenimiseks. Praeguses kasutajaliideses ei eemalda see vestlusi kasutaja vaatest: vestlusajalugu säilib. Sellest seadest olenemata hoiab OpenAI logisid oma serverites väärkasutuse jälgimise ja turvalisuse eesmärgil kuni 30 päeva, enne kui need jäädavalt kustutatakse.
  • Gemini (Google) – privaatsusseadetes tuleb välja lülitada Gemini Apps Activity. Siis ei salvestata uusi vestlusi Google’i kontole ega kasutata neid mudelite treenimiseks. Muudatus ei kustuta siiski logisid kohe teenusepakkuja taristust: Google säilitab neid teenuse turvalisuse tagamiseks kuni 72 tundi.
  • Claude (Anthropic) – tasuta ja tavapärastes tarbijaversioonides kasutatakse sisestatud andmeid praegu vaikimisi mudelite täiustamiseks. See erineb ettevõtte algusaegadest, mil Anthropic rõhutas, et ei kasuta kasutajate vestlusi treenimiseks. Selle keelamiseks tuleb avada konto privaatsusseaded ja lülitada välja andmete jagamise valik Help improve Claude.

Tasub meeles pidada, et privaatsusseadete muutmine ja mudeli treenimiseks antud nõusolekust loobumine mõjutab ainult edasist andmekasutust. Varem saadetud teavet, mis on juba masinõppe käigus mudelisse jõudnud, ei eemalda seadete muutmine närvivõrgust.

Kokkuvõte

  • Tarbijatele mõeldud AI-tööriistadega suhtlemisse tasub suhtuda nii, nagu avaldataks sisestatud teave kõigile. Seetõttu ei tohi neisse sisestada isikuandmeid, meditsiiniandmeid, paroole ega ärisaladusi.
  • Saadetud teavet võidakse töödelda mitmes etapis, sealhulgas kasutada mudelite treenimiseks ja sisu modereerimiseks ning säilitada väliste serverite varukoopiates.
  • Ohutumaks kasutamiseks tuleb andmed enne sisestamist anonüümida, tundlikud märgijadad maskeerida või asendada ning vajaduse korral kasutada DLP-tööriistu.
  • Enterprise-kontod ja ettevõtetele mõeldud pilvekeskkonnad pakuvad rangemaid kaitsenõudeid ning lepingulist kinnitust, et kliendiandmeid ei kasutata avalike mudelite treenimiseks.
  • Privaatsusseadete muutmine ja mudelite treenimisest loobumine mõjutab ainult edasist andmekasutust; see ei eemalda teavet, mis on juba mudeli treenimisel kasutusse võetud.

Lisa kommentaar

Sinu e-postiaadressi ei avaldata. Nõutavad väljad on tähistatud *-ga

Viimati blogis

29.09.2026 Copywriting
28.09.2026 Copywriting
26.09.2026 Copywriting
25.09.2026 Copywriting
24.09.2026 Copywriting
23.09.2026 Copywriting
19.09.2026 Copywriting
18.09.2026 Sisuturundus
17.09.2026 Sisuturundus

Professionaalsed äritekstid

Tasuta hinnapakkumine

Hakake reklaamtekstide kirjutajaks

Karjäär

Praktiline
copywritingi
kursus