기술 거대 기업들이 AI의 데이터 갈증을 충족시키기 위해 경계를 넓힘

- 기술 거대 기업들이 AI 데이터를 수집하기 위해 논란의 여지가 있는 방법들을 동원하고 있다.
- OpenAI 는 YouTube 동영상을 전사하고 있으며, Google 과 Meta 는 저작권이 있는 콘텐츠를 구매하는 것을 고려하고 있다.
- AI 가 방대한 데이터 세트를 사용하는 것에 대해 법적 및 윤리적 논쟁이 제기되고 있다.
오픈AI, 구글, 메타의 작업이 있든, 다양한 창의적이지만 논쟁적인 방식으로 방대한 양의 디지털 데이터를 수집하거나 축적하는 것을 포함하는 산업 부문을 지원하는 AI가 있든, 자동화 능력과 기능이 증가하고 있음은 분명합니다. 특히 위에서 outlined된 조치(즉, 법적 한계와 기업 정책을 고려하는 것)를 취하는 것과 같은 조치를 포함하는 노력은 AI 시스템을 훈련하는 데 사용되는 방대한 양의 데이터와 동등합니다.
오픈AI의 위스퍼 이니셔티브: 유튜브 대화 채굴
우리의 위스퍼 이야기는 작년에 시작되었습니다. 일류 영어 텍스트의 압도적인 부족이 교육 전달을 지연시킵니다. 위스퍼는 구글의 다음 단계였습니다. 그들은 유튜브의 대화 바다를 이해했고 텍스트, 즉 텍스트-음성 변환 애플리케이션으로 개발되었습니다. AI 기반 도구 자체는 100만 시간 이상의 유튜브 비디오가 AI를 통해 감사되어 새로운 텍스트(본질적으로 새로운 대화)를 생성하는 데 사용되었으며, 이는 최신 기술부터 차트GPT 챗봇의 최신 버전인 GPT-4에 이르기까지 생성된 AI 모델을 훈련하는 데 사용되었습니다.
일부 직원들이 오픈AI의 마이크로소프트 영상이 유튜브의 표절이라고 주장했지만, 표절의 윤리는 여전히 논쟁의 여지가 있었습니다. 또한 일부 직원들은 유튜브의 의도와 정확하게 일치하는 것이 불가능할 것이라고 인정했습니다. 마찬가지로, 텍스트 내용을 추출하여 AI 모델에 공급하기 위해 비디오를 알고리즘적으로 처리하는 것에 대한 이의 제기는 비디오 제작자의 저작권에 대한 위협으로 간주되어 분노를 초래했을 수 있습니다.
페이스북과 인스타그램의 모회사인 메타도 사이먼 앤 슈스터와 같은 출판사의 저작권 요소 사용에 대해 우려하고 있었습니다. 동시에 그들은 저작권 침해에 걸릴 수 있는 일반 웹 콘텐츠의 획득에 대해서도 논의했습니다.
데이터 처리: 비전통적 접근 방식의 동력
경쟁이 치열한 데이터 수집은 데이터의 중추적 위치를 주목하고 AI 기술 개발에서 식별하는 데 도움이 됩니다. 언어는 AI에게 더 많은 훈련 데이터 세트를 명령하며, 오늘날 이러한 소스 외부에서 위키백과와 레딧까지 조작됩니다. 전통적인 데이터 저장소와 같은 매우 일반적인 데이터 소스에 도달하는 데 어려움을 겪는 기술 기업들에게 AI 기반 모델을 생성하는 것은 그러한 경우에 충분히 바람직할 수 있는 대안 솔루션이 될 수 있습니다.
기술 기업들은 AI 훈련에 데이터 수집이 필요하다고 주장하는 반면, 동일한 과정은 법적으로 법원에서 의문시되고 있습니다. 방어 차원에서 오픈AI와 마이크로소프트는 저작권 자료의 불법 사용에 대한 혐의에 대해 승소했습니다. 그러나 그들은 그들의 행동이 공정한 사용의 법적 원칙 내에 있다고 말했습니다. 최근 몇 년간 미국 저작권청에 제출된 저작권 소유자의 신청 건수는 10,000건을 초과했으며, 이는 AI 시대의 저작권법이 독특하고 새로운 것임을 명확히 보여줍니다. 결과적으로 주요 플레이어들은 항상 AI 기반 모델을 사용하는 데 라이선스된 목적이 없다는 구실 아래 많은 작품의 침해와 관련된 위험에 직면합니다.
대규모 데이터 세트의 필요성
전반적으로 카이판의 제레드 과학자의 작업은 AI 개발에서 의도치 않게 서사시가 되었습니다. 데이터 기반 콘텐츠는 훈련 과정에 필요한 AI의 구성 요소 중 하나이지만, 잘 훈련되고 효과적으로 작동하는 모델 없이는 잘 작동할 수 없습니다. 인공지능 기술의 증가와 함께 시장에서 성공하기 위한 데이터에 대한 수요는 높은 비율로 증가하여 기업들에게 법, 윤리, 그리고 프라이버시와 관련된 질문을 남깁니다. 따라서 인공지능 알고리즘은 시장에서 성공하기 위해 이러한 데이터 세트를 사용해야 합니다.
AI 향상을 위한 VIP의 데이터 수집 행동이 왜곡되고 있으며, 전형적인 방법론적 맹세는 거칠어지고 있습니다. 유튜브 강연 중 하나를 통하든 합성 데이터 생성을 통하든, 이러한 기업들은 법, 윤리, 그리고 프라이버시 문제가 무엇인지 발견하려는 사명에서 리더입니다.
나중에 바다에서 농담이 될 수도 있습니다. 혁신 과정을 주도하는 데 필요한 방대한 데이터 세트의 출현으로 인해 사회 지도자들은 지적 재산권과 프라이버시의 윤리적 원칙과 혁신 노력을 균형 있게 만드는 규칙과 표준을 개발하기 위해 건설적인 대화에 적극적으로 참여해야 합니다.
원본 이야기 출처: https://www.nytimes.com/2024/04/06/technology/tech-giants-harvest-data-artificial-intelligence.html
이 글을 읽고 계신다면, 이미 앞서 나가고 있습니다. 뉴스레터로 그 위치를 유지하세요.
면책 조항. 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan.com 본 페이지에 제공된 정보를 바탕으로 이루어진 투자에 대해 어떠한 책임도 지지 않습니다. 투자 결정을 내리기 전에 반드시 독립적인 조사나 자격을 갖춘 전문가의 상담을 강력히 권장합니다.

제임스 킨오티
암호화폐 애호가인 제임스는 핀테크, 암호화폐, 블록체인 및 최첨단 기술에 관한 지식을 공유하는 데서 즐거움을 느낍니다. 암호화폐 산업의 최신 혁신, 암호화폐 게임, AI, 블록체인 기술 등 다양한 기술이 그의 주요 관심사입니다. 그의 사명은 다양한 산업에서의 변혁적 응용 기술을 선도하는 것입니다.















