În România, un proiect de crawling este legal atunci când respectă simultan trei condiții: robots.txt-ul site-ului țintă permite accesul la paginile vizate, Termenii și Condițiile nu interzic explicit extragerea automată, iar datele colectate nu includ informații cu caracter personal fără un temei legal documentat. Cele trei condiții funcționează independent — îndeplinirea uneia nu o înlocuiește pe celelalte două.
Cea mai frecventă greșeală nu este ignorarea deliberată a regulilor, ci tratarea robots.txt și GDPR ca și cum ar fi aceeași verificare. Robots.txt răspunde la întrebarea „am voie tehnic să accesez această pagină?”; GDPR răspunde la o întrebare complet diferită — „am voie să stochez datele găsite pe acea pagină?”. Un proiect de crawling poate trece testul robots.txt și, în același timp, să încalce GDPR, dacă paginile permise conțin date personale colectate fără temei.
Acest articol pune cele două verificări într-o singură matrice de decizie, aplicată pe categoriile de date pe care le întâlnește de obicei un proiect de crawling pentru eCommerce sau cercetare de piață în România, și explică unde intervine legislația românească specifică (ANSPDCP, Legea 8/1996 privind drepturile de autor) pe lângă cadrul general GDPR și robots.txt.
Matricea de decizie: robots.txt + GDPR combinate pe categorii de date
Tabelul de mai jos combină cele două filtre într-un singur rezultat practic, pentru categoriile de date cele mai frecvente într-un proiect de crawling orientat spre business.
| Categorie de date | Robots.txt permite de regulă? | Risc GDPR | Poți extrage? |
|---|---|---|---|
| Titlu, preț, cod produs, stoc | Da, dacă pagina de produs nu e în Disallow | Redus | Da, dacă și Termenii și Condițiile permit |
| Descriere tehnică, specificații | Da, de regulă | Redus | Da, cu atenție la drepturile de autor asupra textului |
| Imagini de produs | Depinde de directorul de imagini | Redus | Condiționat de drepturi de autor (Legea 8/1996) |
| Recenzii cu nume complet sau username | De regulă da | Mediu-ridicat | Doar cu autorul anonimizat sau exclus |
| Adrese de email, telefon listate public | De regulă da | Ridicat | Nu, fără temei legal documentat |
| Pagini de administrare, search intern, cont | De regulă blocate prin Disallow | Variabil | Nu — respectă blocarea tehnică |
Clasificarea este orientativă și depinde de site-ul concret vizat; matricea arată tiparul general, nu o garanție legală pentru fiecare caz.
Robots.txt confirmă accesul tehnic, nu conformitatea legală completă
Robots.txt este un fișier text public, plasat la rădăcina unui domeniu, prin care proprietarul unui site indică ce pagini pot fi accesate de roboți și ce pagini preferă să rămână neaccesate. Este primul pas de verificare, dar nu singurul — pentru o explicație completă a directivelor și a riscurilor asociate ignorării lui, vezi ghidul dedicat robots.txt și crawling legal.
Pentru scopul acestui articol, reține un singur lucru: un robots.txt permisiv îți confirmă doar accesul tehnic la pagină. Nu spune nimic despre ce poți face legal cu datele găsite acolo, mai ales dacă acele date includ informații despre persoane fizice.
GDPR decide ce faci cu datele găsite, indiferent de robots.txt
GDPR se aplică oricărei prelucrări de date cu caracter personal ale unor persoane din Uniunea Europeană, indiferent unde este stabilită compania care colectează datele și indiferent dacă informația este publică pe un site sau nu. O informație vizibilă public nu își pierde automat statutul de dată personală.
Pentru o analiză detaliată a temeiurilor legale, categoriilor de date și pașilor de reducere a riscului, consultă ghidul HappyWeb despre GDPR și date personale în crawling. Acest articol nu repetă acea analiză în detaliu; se concentrează pe cum se combină rezultatul GDPR cu rezultatul robots.txt într-o decizie unică, per proiect.
Specific pentru România: ANSPDCP și Legea 8/1996
Pe lângă cadrul GDPR general, aplicabil la nivelul întregii Uniuni Europene, un proiect de crawling derulat din România sau care vizează un site românesc intersectează două elemente locale suplimentare:
- ANSPDCP (Autoritatea Națională de Supraveghere a Prelucrării Datelor cu Caracter Personal) este autoritatea română care aplică GDPR la nivel național și poate investiga sesizări legate de colectarea neautorizată de date personale, inclusiv cele obținute prin crawling.
- Legea 8/1996 privind drepturile de autor și drepturile conexe protejează în România descrierile originale, textele și imaginile publicate pe un site, indiferent de robots.txt sau GDPR — reproducerea integrală a acestui conținut fără drept poate constitui o încălcare separată, distinctă de aspectele de protecție a datelor.
Practic, acest lucru înseamnă că un proiect de crawling care respectă robots.txt și GDPR poate încă avea o problemă legală dacă reproduce identic descrieri sau imagini protejate prin drepturi de autor, în loc să le proceseze sau să le adapteze pentru uz propriu.
Cum decizi, pas cu pas, dacă poți extrage o categorie de date
Pentru fiecare tip de date pe care vrei să-l extragi de pe un site, parcurge secvența de mai jos:
- Verifică dacă pagina care conține datele este permisă în robots.txt pentru user-agentul folosit de scriptul tău.
- Citește Termenii și Condițiile site-ului țintă pentru clauze despre extragere automată, reproducere de conținut sau interdicții explicite de scraping.
- Întreabă-te dacă datele respective identifică, direct sau indirect, o persoană fizică — dacă da, ai nevoie de un temei legal documentat înainte de a le colecta.
- Dacă datele sunt text sau imagini originale (nu simple fapte precum preț sau cod), verifică dacă intenționezi să le reproduci identic sau să le procesezi/adaptezi.
- Documentează intern rezultatul acestei verificări pentru fiecare sursă nouă, înainte de a lansa colectarea la scară.
- Pentru volume mari de date sau surse cu conținut sensibil, cere o verificare juridică de specialitate înainte de a construi scriptul definitiv.
Riscuri frecvente când cele două verificări sunt tratate ca una singură
Cea mai comună eroare de proiect este oprirea verificării după robots.txt, considerând că „dacă tehnic pot accesa, pot și stoca orice găsesc acolo”. Consecințele practice ale acestei confuzii:
| Greșeală frecventă | Consecință posibilă | Mitigare |
|---|---|---|
| Robots.txt verificat, GDPR ignorat | Colectare neintenționată de nume/email din recenzii sau profiluri | Filtrează explicit câmpurile personale în script, la sursă |
| Reproducere identică a descrierilor de produs | Risc de încălcare a Legii 8/1996 privind drepturile de autor | Procesează/adaptează textul, nu îl copia identic |
| Ignorarea Termenilor și Condițiilor | Solicitare de încetare din partea proprietarului site-ului | Citește secțiunea despre extragere automată înainte de proiect |
| Lipsa documentației interne a deciziei | Dificultate în a demonstra buna-credință la o eventuală sesizare | Notează, per sursă, ce a fost verificat și când |
Crawling intern vs serviciu extern: cine parcurge matricea de decizie
O echipă internă poate construi tehnic un crawler, dar rareori are un proces sistematic de verificare pentru fiecare sursă nouă — robots.txt, Termeni și Condiții, GDPR și drepturi de autor, toate patru, de fiecare dată. Un serviciu de crawling personalizat tratează această matrice de decizie ca parte standard a proiectului, nu ca verificare opțională făcută după ce scriptul rulează deja în producție.
Întrebări frecvente despre crawling legal în România
Dacă un site nu are robots.txt, pot extrage orice de pe el?
Nu. Lipsa unui fișier robots.txt înseamnă doar că site-ul nu a publicat restricții explicite de acces pentru roboți; nu elimină verificarea Termenilor și Condițiilor, nici obligațiile GDPR pentru orice dată personală găsită pe site, nici protecția drepturilor de autor asupra conținutului original.
Pot extrage prețuri de la competitori fără să încalc legea?
De regulă da, dacă robots.txt permite accesul la paginile de produs și Termenii și Condițiile nu interzic explicit extragerea automată. Prețul, ca atare, nu este o dată cu caracter personal.
Ce fac dacă datele pe care vreau să le extrag conțin și nume de persoane?
Exclude explicit acele câmpuri din scriptul de crawling sau anonimizează-le înainte de stocare. Recomandarea practică este să filtrezi datele personale la sursă, nu să le colectezi și să le protejezi ulterior.
ANSPDCP poate sancționa o companie pentru date colectate prin crawling?
Da, dacă o sesizare sau un control arată că au fost prelucrate date cu caracter personal fără temei legal, ANSPDCP poate investiga și aplica sancțiuni, în baza atribuțiilor sale de aplicare a GDPR la nivel național.
E suficient să respect robots.txt ca să fiu în siguranță legal?
Nu. Robots.txt confirmă doar accesul tehnic permis. Conformitatea legală completă depinde și de Termenii și Condițiile site-ului, de tratarea corectă a datelor personale conform GDPR și, pentru conținut original, de respectarea drepturilor de autor.
Concluzie: verifică toate cele trei filtre, nu doar unul
Un proiect de crawling legal în România nu se rezumă la un singur fișier sau o singură regulă — este intersecția dintre accesul tehnic permis de robots.txt, permisiunile din Termenii și Condițiile site-ului țintă și tratarea corectă a datelor personale conform GDPR, cu atenție suplimentară la drepturile de autor pentru conținutul original. Matricea de decizie de mai sus îți arată rapid unde se află fiecare categorie de date pe care vrei să o extragi.
Vezi serviciul complet de preluare date online prin crawling, cu verificare legală inclusă din faza de planificare, sau discută proiectul tău cu echipa HappyWeb pentru o evaluare aplicată exact sursei tale de date.
Surse
- Google Search Central — Introducere în robots.txt: developers.google.com/search/docs/crawling-indexing/robots/intro.
- GDPR.eu — Ce este GDPR: gdpr.eu/what-is-gdpr.
- ANSPDCP — Autoritatea Națională de Supraveghere a Prelucrării Datelor cu Caracter Personal: dataprotection.ro.
- Legea 8/1996 privind drepturile de autor și drepturile conexe (text consolidat, Legislație.just.ro): legislatie.just.ro.
- Serviciul HappyWeb de preluare date online prin crawling: happyweb.ro/servicii/servicii-servicii-preluare-date-online-crawling.
Notă: informațiile despre aspecte legale din acest articol au caracter orientativ și nu constituie consultanță juridică. Pentru proiecte de crawling cu volum mare de date sau surse sensibile, recomandăm verificarea directă a Termenilor și Condițiilor site-ului țintă și consultarea unui specialist juridic sau a unui responsabil cu protecția datelor (DPO).
Imagine generată cu AI, folosită în scop ilustrativ.
Scrie un comentariu