Crawling legal în România: ce poți extrage de pe un site fără să încalci robots.txt și GDPR

În România, un proiect de crawling este legal atunci când respectă simultan trei condiții: robots.txt-ul site-ului țintă permite accesul la paginile vizate, Termenii și Condițiile nu interzic explicit extragerea automată, iar datele colectate nu includ informații cu caracter personal fără un temei legal documentat. Cele trei condiții funcționează independent — îndeplinirea uneia nu o înlocuiește pe celelalte două.

Cea mai frecventă greșeală nu este ignorarea deliberată a regulilor, ci tratarea robots.txt și GDPR ca și cum ar fi aceeași verificare. Robots.txt răspunde la întrebarea „am voie tehnic să accesez această pagină?”; GDPR răspunde la o întrebare complet diferită — „am voie să stochez datele găsite pe acea pagină?”. Un proiect de crawling poate trece testul robots.txt și, în același timp, să încalce GDPR, dacă paginile permise conțin date personale colectate fără temei.

Acest articol pune cele două verificări într-o singură matrice de decizie, aplicată pe categoriile de date pe care le întâlnește de obicei un proiect de crawling pentru eCommerce sau cercetare de piață în România, și explică unde intervine legislația românească specifică (ANSPDCP, Legea 8/1996 privind drepturile de autor) pe lângă cadrul general GDPR și robots.txt.

Matricea de decizie: robots.txt + GDPR combinate pe categorii de date

Tabelul de mai jos combină cele două filtre într-un singur rezultat practic, pentru categoriile de date cele mai frecvente într-un proiect de crawling orientat spre business.

Categorie de dateRobots.txt permite de regulă?Risc GDPRPoți extrage?
Titlu, preț, cod produs, stocDa, dacă pagina de produs nu e în DisallowRedusDa, dacă și Termenii și Condițiile permit
Descriere tehnică, specificațiiDa, de regulăRedusDa, cu atenție la drepturile de autor asupra textului
Imagini de produsDepinde de directorul de imaginiRedusCondiționat de drepturi de autor (Legea 8/1996)
Recenzii cu nume complet sau usernameDe regulă daMediu-ridicatDoar cu autorul anonimizat sau exclus
Adrese de email, telefon listate publicDe regulă daRidicatNu, fără temei legal documentat
Pagini de administrare, search intern, contDe regulă blocate prin DisallowVariabilNu — respectă blocarea tehnică

Clasificarea este orientativă și depinde de site-ul concret vizat; matricea arată tiparul general, nu o garanție legală pentru fiecare caz.

Robots.txt confirmă accesul tehnic, nu conformitatea legală completă

Robots.txt este un fișier text public, plasat la rădăcina unui domeniu, prin care proprietarul unui site indică ce pagini pot fi accesate de roboți și ce pagini preferă să rămână neaccesate. Este primul pas de verificare, dar nu singurul — pentru o explicație completă a directivelor și a riscurilor asociate ignorării lui, vezi ghidul dedicat robots.txt și crawling legal.

Pentru scopul acestui articol, reține un singur lucru: un robots.txt permisiv îți confirmă doar accesul tehnic la pagină. Nu spune nimic despre ce poți face legal cu datele găsite acolo, mai ales dacă acele date includ informații despre persoane fizice.

GDPR decide ce faci cu datele găsite, indiferent de robots.txt

GDPR se aplică oricărei prelucrări de date cu caracter personal ale unor persoane din Uniunea Europeană, indiferent unde este stabilită compania care colectează datele și indiferent dacă informația este publică pe un site sau nu. O informație vizibilă public nu își pierde automat statutul de dată personală.

Pentru o analiză detaliată a temeiurilor legale, categoriilor de date și pașilor de reducere a riscului, consultă ghidul HappyWeb despre GDPR și date personale în crawling. Acest articol nu repetă acea analiză în detaliu; se concentrează pe cum se combină rezultatul GDPR cu rezultatul robots.txt într-o decizie unică, per proiect.

Specific pentru România: ANSPDCP și Legea 8/1996

Pe lângă cadrul GDPR general, aplicabil la nivelul întregii Uniuni Europene, un proiect de crawling derulat din România sau care vizează un site românesc intersectează două elemente locale suplimentare:

  • ANSPDCP (Autoritatea Națională de Supraveghere a Prelucrării Datelor cu Caracter Personal) este autoritatea română care aplică GDPR la nivel național și poate investiga sesizări legate de colectarea neautorizată de date personale, inclusiv cele obținute prin crawling.
  • Legea 8/1996 privind drepturile de autor și drepturile conexe protejează în România descrierile originale, textele și imaginile publicate pe un site, indiferent de robots.txt sau GDPR — reproducerea integrală a acestui conținut fără drept poate constitui o încălcare separată, distinctă de aspectele de protecție a datelor.

Practic, acest lucru înseamnă că un proiect de crawling care respectă robots.txt și GDPR poate încă avea o problemă legală dacă reproduce identic descrieri sau imagini protejate prin drepturi de autor, în loc să le proceseze sau să le adapteze pentru uz propriu.

Cum decizi, pas cu pas, dacă poți extrage o categorie de date

Pentru fiecare tip de date pe care vrei să-l extragi de pe un site, parcurge secvența de mai jos:

  1. Verifică dacă pagina care conține datele este permisă în robots.txt pentru user-agentul folosit de scriptul tău.
  2. Citește Termenii și Condițiile site-ului țintă pentru clauze despre extragere automată, reproducere de conținut sau interdicții explicite de scraping.
  3. Întreabă-te dacă datele respective identifică, direct sau indirect, o persoană fizică — dacă da, ai nevoie de un temei legal documentat înainte de a le colecta.
  4. Dacă datele sunt text sau imagini originale (nu simple fapte precum preț sau cod), verifică dacă intenționezi să le reproduci identic sau să le procesezi/adaptezi.
  5. Documentează intern rezultatul acestei verificări pentru fiecare sursă nouă, înainte de a lansa colectarea la scară.
  6. Pentru volume mari de date sau surse cu conținut sensibil, cere o verificare juridică de specialitate înainte de a construi scriptul definitiv.

Riscuri frecvente când cele două verificări sunt tratate ca una singură

Cea mai comună eroare de proiect este oprirea verificării după robots.txt, considerând că „dacă tehnic pot accesa, pot și stoca orice găsesc acolo”. Consecințele practice ale acestei confuzii:

Greșeală frecventăConsecință posibilăMitigare
Robots.txt verificat, GDPR ignoratColectare neintenționată de nume/email din recenzii sau profiluriFiltrează explicit câmpurile personale în script, la sursă
Reproducere identică a descrierilor de produsRisc de încălcare a Legii 8/1996 privind drepturile de autorProcesează/adaptează textul, nu îl copia identic
Ignorarea Termenilor și CondițiilorSolicitare de încetare din partea proprietarului site-uluiCitește secțiunea despre extragere automată înainte de proiect
Lipsa documentației interne a decizieiDificultate în a demonstra buna-credință la o eventuală sesizareNotează, per sursă, ce a fost verificat și când

Crawling intern vs serviciu extern: cine parcurge matricea de decizie

O echipă internă poate construi tehnic un crawler, dar rareori are un proces sistematic de verificare pentru fiecare sursă nouă — robots.txt, Termeni și Condiții, GDPR și drepturi de autor, toate patru, de fiecare dată. Un serviciu de crawling personalizat tratează această matrice de decizie ca parte standard a proiectului, nu ca verificare opțională făcută după ce scriptul rulează deja în producție.

Întrebări frecvente despre crawling legal în România

Dacă un site nu are robots.txt, pot extrage orice de pe el?

Nu. Lipsa unui fișier robots.txt înseamnă doar că site-ul nu a publicat restricții explicite de acces pentru roboți; nu elimină verificarea Termenilor și Condițiilor, nici obligațiile GDPR pentru orice dată personală găsită pe site, nici protecția drepturilor de autor asupra conținutului original.

Pot extrage prețuri de la competitori fără să încalc legea?

De regulă da, dacă robots.txt permite accesul la paginile de produs și Termenii și Condițiile nu interzic explicit extragerea automată. Prețul, ca atare, nu este o dată cu caracter personal.

Ce fac dacă datele pe care vreau să le extrag conțin și nume de persoane?

Exclude explicit acele câmpuri din scriptul de crawling sau anonimizează-le înainte de stocare. Recomandarea practică este să filtrezi datele personale la sursă, nu să le colectezi și să le protejezi ulterior.

ANSPDCP poate sancționa o companie pentru date colectate prin crawling?

Da, dacă o sesizare sau un control arată că au fost prelucrate date cu caracter personal fără temei legal, ANSPDCP poate investiga și aplica sancțiuni, în baza atribuțiilor sale de aplicare a GDPR la nivel național.

E suficient să respect robots.txt ca să fiu în siguranță legal?

Nu. Robots.txt confirmă doar accesul tehnic permis. Conformitatea legală completă depinde și de Termenii și Condițiile site-ului, de tratarea corectă a datelor personale conform GDPR și, pentru conținut original, de respectarea drepturilor de autor.

Concluzie: verifică toate cele trei filtre, nu doar unul

Un proiect de crawling legal în România nu se rezumă la un singur fișier sau o singură regulă — este intersecția dintre accesul tehnic permis de robots.txt, permisiunile din Termenii și Condițiile site-ului țintă și tratarea corectă a datelor personale conform GDPR, cu atenție suplimentară la drepturile de autor pentru conținutul original. Matricea de decizie de mai sus îți arată rapid unde se află fiecare categorie de date pe care vrei să o extragi.

Vezi serviciul complet de preluare date online prin crawling, cu verificare legală inclusă din faza de planificare, sau discută proiectul tău cu echipa HappyWeb pentru o evaluare aplicată exact sursei tale de date.

Surse

Notă: informațiile despre aspecte legale din acest articol au caracter orientativ și nu constituie consultanță juridică. Pentru proiecte de crawling cu volum mare de date sau surse sensibile, recomandăm verificarea directă a Termenilor și Condițiilor site-ului țintă și consultarea unui specialist juridic sau a unui responsabil cu protecția datelor (DPO).

Imagine generată cu AI, folosită în scop ilustrativ.

Despre autor

Ana-Maria Ispas

 

Scrie un comentariu

* Campurile marcate cu * sunt obligatorii