웹 스크래핑의 합법성 평가

웹 스크래핑의 합법성에 대한 실용적인 가이드: 공개 데이터, GDPR, CCPA, 저작권, 서비스 약관, 그리고 Bright Data가 규정을 준수하는 방법.
1 분 읽기
Assessing the Legality of Web Scraping

면책 조항: 이 글은 정보 제공 목적으로만 작성되었으며 법적 조언이 아닙니다. 모든 고객이 자격을 갖춘 변호사와 상담하시기를 강력히 권장합니다.

웹 스크래핑이라고도 불리는 자동화된 웹 데이터 수집은 수동 탐색이 아닌 소프트웨어를 사용하여 웹사이트에서 데이터를 추출하는 과정을 말합니다. 생성형 AI, 시장 인텔리전스, 금융 모델링부터 학술 연구 및 SEO에 이르기까지 다양한 사용 사례에서 중요한 역할을 합니다. 그러나 웹 스크래핑을 수행하는 방법은 다양하며, 책임감 있고 규정을 준수하는 방식으로 수행하는 것이 중요합니다.

웹 스크래핑과 관련된 법적 위치를 평가하려면 네 가지 주요 요소를 검토해야 합니다:

  • 수집되는 데이터의 유형
  • 웹사이트의 지리적 위치
  • 데이터 수집 방법, 그리고
  • 데이터 활용 방법

이 글에서는 이러한 고려 사항과 웹 스크래핑을 둘러싼 법적 환경을 살펴보며, 점점 보편화되고 있는 자동화 데이터 수집 관행을 둘러싼 법적 환경을 더 잘 이해할 수 있도록 돕겠습니다.

Bright Data의 법적 승소

Bright Data는 자동화된 웹 데이터 수집을 둘러싼 법적 논쟁의 최전선에 있으며, Meta와 X를 상대로 두 건의 주요 소송에서 승소했습니다. 이러한 법적 도전에서 Bright Data의 역할은 명확한 경계를 정의하고 전체 업계의 이익을 위해 공개 데이터에 접근할 권리를 확보하는 데 결정적인 역할을 했습니다. 두 사례 모두에서 Meta와 X는 자사의 서비스 약관이 구속력 있는 계약과 같으며, 플랫폼을 방문하는 모든 사람은 자동으로 해당 약관에 구속된다고 주장했습니다.

Meta v. Bright Data 사건에서 Meta는 Bright Data가 자사 플랫폼에서 데이터를 수집함으로써 서비스 약관을 위반했다고 주장했습니다. 법원은 Bright Data가 공개 계정의 데이터만 수집했기 때문에(Meta 계정을 만든 후에만 볼 수 있는 계정과 달리), Meta의 약관은 로그아웃 상태에서 공개적으로 이용 가능한 데이터를 자동으로 스크래핑하는 Bright Data의 행위에 적용되거나 이를 금지하지 않는다고 판결했습니다.

X Corp. v. Bright Data 사건에서 X는 Bright Data의 데이터 수집 활동이 이용 약관을 위반했다고 주장했지만, 법원은 X의 주장이 저작권법에 의해 선점된다고 판결하며 X의 청구를 기각했습니다. 법원은 또한 X의 약관을 Bright Data의 스크래핑에 적용할 경우, 저작권 보호 대상이 아닌 콘텐츠를 보호하는 결과가 된다고 판시했습니다.

어떤 데이터를 수집하는가?

데이터 수집을 규제하는 법률은 무엇보다도 콘텐츠에 따라 다릅니다. 즉, 공개 데이터, 뉴스 기사, 개인 정보, 또는 안면 스캔 중 어떤 것을 스크래핑하느냐에 따라 적용되는 법률의 유형이 크게 달라집니다.

공개적으로 이용 가능한 데이터인가?

Bright Data는 공개적으로 이용 가능한 데이터만 수집합니다. 최근 법원 판결에 따르면 공개된 로그아웃 상태의 웹 데이터 수집은 비공개 또는 인증된 데이터에 접근하는 것과 법적으로 구별됩니다. hiQ Labs v. LinkedIn 및 Meta v. Bright Data와 같은 판결은 로그아웃된 공개 데이터에 접근하는 것이 컴퓨터 사기 및 남용 방지법(CFAA)상 무단 접근을 구성하지 않으며, 계정 기반 약관에 명시적으로 동의하지 않은 사람들에게 계약 위반이 되지 않는다고 확립했습니다.

개인정보 보호 체계는 개인 데이터 처리에 법적 책임을 부과하지만(이를 금지하지는 않음), CCPA를 포함한 많은 개인정보 보호법은 명시적으로 “공개적으로 이용 가능한 정보”를 그 적용 범위에서 제외합니다. 이 예외 조항은 일반적으로 정부 기록에서 합법적으로 공개된 데이터 또는 소비자나 광범위하게 배포된 미디어에 의해 일반 대중에게 합법적으로 제공된다고 사업자가 합리적으로 믿을 수 있는 데이터를 포함합니다.

데이터가 저작권으로 보호되는가?

가격, 제품명, 기상 데이터 또는 재고 수준과 같은 순수한 사실은 일반적으로 저작권 보호의 예외에 해당합니다. 대부분의 국가에서 저작권은 사실, 아이디어 및 프로세스가 아닌 독창적이고 창의적인 표현만을 보호합니다.

일반적으로 저작권 보호 범위 밖에 있는 예시:

  • 제품 가격
  • 재고 가용성
  • 사업체명
  • 짧은 사실적 목록
  • 기본 연락처 정보

예를 들어, 2026년 7월 Google v. SerpApi 사건의 최근 판결에서 Google의 검색 결과는 저작권으로 보호되지 않는다고 명확히 했습니다.

공정 이용에 해당하는가?

저작권법은 창작자에게 작품의 사용, 복제 및 배포에 대한 독점적 권리를 부여함으로써 텍스트, 이미지, 음악, 심지어 소프트웨어와 같은 독창적인 창작물을 보호합니다.

미국에서는 공정 이용 원칙이 저작권이 있더라도 특정 콘텐츠 사용이 합법적인지 평가하는 체계를 제공합니다. 공정 이용 여부를 결정하는 것은 사실에 매우 민감하지만, 궁극적으로 다음 네 가지 요소를 고려합니다:

  1. “변형적”이고 상업적인지 여부를 포함한 사용의 목적과 성격;
  2. 저작권이 있는 저작물의 성격;
  3. 복사된 양과 실질성;
  4. 원본 또는 허가된 파생물 시장에 미치는 영향.

다른 관할권에도 유사하지만 구별되는 원칙이 존재합니다.

개인 데이터인가?

데이터 개인정보 보호법은 개인 데이터(개인 정보라고도 함)가 수집, 사용, 공유 및 판매되는 방식을 규율합니다. 개인 데이터는 종종 식별 가능한 개인과 관련된 모든 데이터로 정의됩니다. 많은 관할권에서 개인정보 보호법은 개인 데이터 처리에 대한 합법적인 근거를 요구하며, 일반적으로 데이터를 수집하는 당사자와 데이터를 수신하는 당사자 모두에게 준수 요건을 부과합니다. 개인 데이터의 모든 수집은 적용 가능한 데이터 개인정보 보호법 및 규정을 준수하여 이루어져야 합니다.

민감한 개인 데이터인가?

개인정보 보호법은 “민감한” 것으로 간주되는 개인 데이터에 대해 강화된 보호를 포함합니다. 민감한 개인 데이터의 정의는 관할권에 따라 다르지만 건강 상태, 종교적 신념, 정치적 성향과 같은 속성을 포함합니다. 이 데이터는 일반적으로 처리 전에 데이터 주체의 명시적 동의를 요구합니다. 대부분의 경우 공개적으로 이용 가능한 데이터에는 민감한 데이터가 포함되지 않으며, Bright Data는 공개적으로 이용 가능한 데이터만 수집합니다!

아동 데이터인가?

미성년자와 관련된 데이터는 미국의 COPPA 및 전 세계적으로 연령에 적합한 디자인 코드와 같은 법률에 의해 엄격하게 규제됩니다. 의도치 않게 또는 체계적으로 아동 정보를 수집하는 플랫폼을 스크래핑하는 경우 심각한 처벌과 의무적 삭제 명령에 직면합니다. 최근 규제 동향은 기업이 젊은 층이 자주 이용하는 플랫폼을 스크래핑할 때 “연령 제한” 또는 데이터 필터링 메커니즘을 구현해야 한다는 점을 강조합니다. Bright Data는 아동 관련 데이터 수집을 금지하고 그러한 데이터를 표시하고 제거하는 기술적 조치를 사용합니다.

생체 인식 데이터인가?

얼굴 인식이나 생체 인식을 위한 이미지 스크래핑은 고위험으로 간주됩니다. 이미지가 공개된 것이라도 동의 없이 생체 인식 템플릿을 추출하는 것은 일리노이 주의 BIPA와 같은 특별 법령을 위반할 수 있습니다. 현대의 법적 기준은 출처의 공개 여부와 관계없이 이러한 데이터 포인트의 자동화된 추출을 즉각적인 통지 및 동의 요건을 촉발하는 “수집”으로 점점 더 취급하고 있습니다.

데이터는 어디에 있는가?

인터넷이 국경이 없어 보일 수 있지만, 법적 권한은 일반적으로 데이터 주체의 거주지나 처리 활동의 특정 위치와 같은 요소에 의해 결정됩니다. 현재 공개적으로 접근 가능한 웹 데이터의 자동화된 수집을 자체적으로 금지하는 포괄적인 법령은 없습니다. 대신 각 국가는 특정 유형의 데이터와 해당 데이터를 얻는 데 사용되는 특정 활동을 규제하는 다양한 법률을 가지고 있습니다. 위에서 설명한 법률 유형(저작권, 개인정보 보호법 등) 간에는 중요한 차이가 있으므로 법률 자문을 구하는 것이 중요합니다.

데이터에 유럽 개인의 개인 데이터가 포함되어 있는가?

EU는 생성형 AI 훈련 목적으로 개인 데이터를 스크래핑하는 것이 GDPR의 적용을 받으며, 따라서 목적 제한, 투명성, 데이터 최소화와 같은 원칙을 엄격히 준수해야 한다는 신호를 보냈습니다. Bright Data는 GDPR 준수에 완전히 전념하며 EU 데이터 주체 권리를 존중하기 위한 강력한 준수 프로그램을 구현했습니다.

데이터는 어떻게 수집되는가?

온라인에서 데이터에 접근하고 수집하는 데 사용하는 방법은 사용 사례의 위험성과 합법성에 상당한 영향을 미칩니다. 미국의 컴퓨터 사기 및 남용 방지법(CFAA)과 같은 사이버 범죄법은 일반적으로 “컴퓨터 시스템”에 대한 무단 접근을 금지하지만, 법원은 점점 더 공개 데이터와 비공개 데이터를 구별하고 있습니다. 영국의 컴퓨터 오용법과 같은 유사한 원칙이 국제적으로도 존재하며, 개인 데이터가 관련될 때 개인정보 보호 체계와 겹칠 수 있는 무단 접근도 규제합니다. 따라서 법적 위험은 데이터가 공개적으로 이용 가능한지 또는 로그인이나 유료 장벽과 같은 기술적 장벽 뒤에 제한되어 있는지에 따라 달라집니다. 이러한 법률을 준수하기 위해 Bright Data는 공개적으로 접근 가능한 데이터만 수집합니다.

데이터가 계정을 통해서만 접근 가능한가?

인터넷 브라우저가 있는 누구나 자유롭게 접근할 수 있는 공개된 로그아웃 상태의 웹 데이터는 일반적으로 속도 제한 준수 및 민감한 데이터 회피와 같은 적용 법률 및 윤리적 원칙을 준수하는 조건으로 법적으로 허용됩니다.

반대로 로그인 또는 계정 기반 스크래핑은 더 높은 위험을 수반합니다. 플랫폼이 계정 등록을 요구하는 경우, 사용자는 일반적으로 스크래핑을 명시적으로 금지하는 클릭랩 의무에 동의하게 됩니다. 이러한 계약상 허가를 초과하거나, 가짜 또는 구매한 계정과 같은 기만적인 전술을 사용하거나, 일반 대중에게 제공되지 않는 데이터에 접근하면 법적 위험이 증가할 수 있습니다.

robots.txt는 어떤가?

robots.txt 파일은 웹 크롤러에게 사이트의 어느 부분에 접근하거나 색인화할 수 있는지를 나타내는 웹사이트의 지침 집합입니다. robots.txt 자체는 법적 강제력이 없으며 법적 체계로 의도된 것이 아닙니다. 예를 들어, 최근 미국 연방 법원 사건에서 robots.txt는 “잔디에 들어가지 마시오” 잔디 표지판이 방문객을 잔디에서 막지 못하는 것 이상으로 접근을 효과적으로 제어하지 못하기 때문에 디지털 밀레니엄 저작권법(DMCA)상 기술적 보호 조치를 구성하지 않는다고 판결했습니다(Ziff Davis, Inc. v. OpenAI, Inc.).

데이터 수집에 프록시 네트워크를 사용할 수 있는가?

웹 데이터 수집을 위한 프록시 네트워크 사용은 공개 정보 수집을 위한 표준 관행입니다. X Corp. v. Bright Data 사건에서 법원은 프록시 사용이 본질적으로 기만적이지 않으며 인터넷 사용자는 일반적으로 특정 IP 주소로 자신을 식별할 적극적인 의무가 없다고 판결했습니다. 그러나 프록시 네트워크는 윤리적으로 소싱되어야 하며, 이는 프록시 제공업체가 적절한 “고객 신원 확인”(KYC) 프로토콜을 포함한 높은 준수 기준을 유지하도록 보장하는 것을 의미합니다.

데이터는 어떻게 사용되는가?

웹 스크래핑과 관련된 법적 위험은 수집된 후 데이터가 어떻게 사용되는지에 따라 크게 달라집니다. 고도로 규제된 부문에서는 고용, 주택 또는 신용 관련 의사 결정에 스크래핑된 개인 데이터를 활용하면 공정 신용 보고법(FCRA) 또는 GDPR의 자동화된 의사 결정 규정과 같은 부문별 법률을 촉발할 수 있습니다. Bright Data는 수집하는 데이터의 윤리적 사용을 촉진하기 위해 계약적 및 기술적 조치를 결합하여 사용합니다.

모범 사례 체크리스트

Bright Data에서는 최고 수준의 데이터 수집 기준을 준수합니다. 모든 사용자가 윤리적이고 지속 가능한 데이터 수집을 보장하기 위해 이러한 업계 선도적인 모범 사례를 채택하여 우리의 선례를 따르도록 권장합니다.

  • 공개된 로그아웃 상태의 데이터를 수집하세요.
  • 법적 승인 없이 로그인, 유료 장벽 또는 기술적 접근 통제 뒤에서 스크래핑하지 마세요.
  • 가짜 계정 생성, 자격 증명 오용 또는 기만적인 접근을 하지 마세요.
  • 항상 합리적인 속도 제한을 사용하세요.
  • 서버 부하나 성능 저하를 절대 유발하지 마세요.
  • 필요한 최소한의 데이터만 수집하세요.
  • 개인 데이터에 대한 개인정보 보호 검토를 수행하세요.
  • 동의 없이 민감한 개인 데이터를 수집하지 마세요.
  • 유효한 삭제, 수신 거부 및 게시 중단 요청을 존중하세요.
  • Bright Data의 윤리적으로 소싱된 프록시를 사용하세요.
  • AI 훈련 및 규제 사용 사례에 대한 법적 위험을 재평가하세요.
  • 공급업체 실사를 수행하세요.
  • 법적 검토 기록을 보관하세요.