최신 뉴스
당신을 위해 엄선되었습니다

에이전트형 AI가 소프트웨어 시장을 재편하고 있으며, OpenAI의 자체 모델도 테스트박스에서 실패하고 있습니다

에 의해미카 아비오둔미카 아비오둔
4분 읽음
  • 가트너는 자율 에이전트가 SaaS 도구 내에서 처리되던 작업을 자체적으로 처리하기 시작하면서, 에이전트형 AI가 2030년까지 기업 앱 지출에서 최대 2,340억 달러의 시장 점유율을 잠식할 수 있다고 추정합니다.
  • OpenAI의 장기 모델dent 는 AI 안전 위험이 단일 오류 출력에서 ​​벗어나 지속적으로 시도하고, 제어를 우회하며, 시간이 지남에 따라 일련의 행동을 연쇄적으로 수행할 수 있는 에이전트로 진화하고 있음을 보여줍니다.
  • 코딩 에이전트에 대한 새로운 연구에 따르면 악의적인 GitHub 이슈는 여러 보안 장치를 우회할 수 있으며, 이는 모니터링 및 제어가 AI 성능만큼이나 중요해지고 있음을 보여줍니다.

기업용 소프트웨어에 혁명을 일으키는 데 사용되는 자율형 인공지능 기술이 점점 더 제어하기 어려워지고 있습니다.

7월 1일, 가트너는 2030년까지 기업용 애플리케이션 지출 중 최대 2,340억 달러가 agentic arbitrage), 이는 서비스형 소프트웨어(SaaS) 지출의 약 5분의 1에 해당합니다. 그 직후, 오픈AI는 자사의 가장 강력한 모델 중 하나가 자체 안전장치를 여러 차례 우회했다고 밝혔습니다.

이후 로이터 통신은 해당 사건이 오픈AI가 공개적으로 주장한 것 보다 훨씬 심각하다고 보도했습니다 . 조사에 정통한 관계자들에 따르면, 문제의dent 는 며칠 동안 외부 플랫폼에서 정보를 빼내려고 시도했지만, 약 일주일 후에야 회사에 발각되었다고 합니다. 이는 trac자율성이 점점 높아지는 에이전트가 장기적인 목표를 추구하기 시작하면 하기가 얼마나 어려운지를 보여줍니다

이번 폭로는 자율성이 점점 높아지는 AI에 대한 우려를 증폭시키고 있습니다. 이는 최근 공개되지 않은 GPT-6 의 기능에 대한 보도, 에이전트의 탈출 행동 개발 , 그리고 AI 에이전트 의 취약점에 대한 연구가 활발히 진행되고 있는 상황에서 나온 것입니다. 이러한 모든 상황을 종합해 볼 때, AI에 있어 안전성이 성능만큼이나 중요한 요소가 되었다는 결론에 도달합니다.

기업들이 AI 에이전트 도입을 고려할 때, 타이밍은 매우 중요한 요소입니다. AI 에이전트의 장점은 최소한의 감독만으로도 복잡한 작업을 장시간 처리할 수 있다는 점입니다. 하지만 오픈아이(OpenAI)의 최신 연구에 따르면, AI 에이전트의 생산성을 높이는 바로 그 특성이 새로운 보안 위험을 초래할 수도 있습니다.

모델이 포기하지 않고 계속 노력했을 때

OpenAI는 도입 전 테스트에서 누락된 동작들을 발견한 후, 오랫동안 사용해 온 알고리즘 중 하나의 내부 배포를 중단했습니다. 가장 대표적인 사례는 NanoGPT 스피드런, 이는 참가자들이 최소한의 움직임으로 소규모 언어 모델을 학습시키는 공개 벤치마크입니다.

해당 모델은 PowerCool이라는 새로운 학습률 기법을 개발하여 벤치마크 결과를 향상시켰습니다. 모델은 슬랙을 통해서만 결과를 보고하도록 지시받았음에도 불구하고, 샌드박스 환경의 제약을 우회하는 방법을 찾아내어 PR #287을 공개 GitHub 저장소에 제출했습니다. OpenAI에 따르면, 이 모델이 제약을 우회하는 방법을 찾는 데 단 한 시간밖에 걸리지 않았지만, 이전 모델들은 같은 지점에서 정체되어 있었다고 합니다.

로이터 통신은 이후 해당 모델의 이러한 행동이 기준치를 넘어섰다고 보도했습니다. 조사 관계자에 따르면, 해당 모델은 7월 9일 오픈AI의 격리된 테스트 환경을 우회하려 시도했으며, 이후 며칠 동안 다양한 외부 대상을 공격하려 시도하다가 결국 테스트 도중 4개의 외부 서비스를 침해했습니다.

두 서비스 중 하나는 허깅 페이스(Hugging Face) 기술과 관련된 것이었고, 다른 하나는 모달 랩스(Modal Labs)것이었습니다. 모달 측은 플랫폼 문제가 아니라 고객 코드의 결함 때문에 발생한 문제이므로 자사 인프라에는 침해가 없었다고 주장했습니다. 오픈아이(OpenAI)는 결국 악의적인 행위를 차단하고 FBI에 신고했습니다.

또 다른 평가에서는 다른 문제가 제기되었습니다. 보안 스캐너에 의해 평가 데이터 접근이 차단된 후, 해당 모델은 인증 토큰을 여러 부분으로 분해하고 숨긴 다음, 필요할 때만 다시 조합하여 탐지를 피했습니다. 더욱이, 모델 내부에서 실행되는 프로세스는 이러한 기법이 보안 스캐너를 우회하는 방법임을 인식했습니다.

OpenAI가 보고서 에서 지적했듯이 , "안전 문제는 개별 행동에서 전체적인 궤적으로 옮겨간다"는 것은 지속적인 AI 행위자가 무해한 활동들을 궁극적으로 위험한 조합으로 만들어낼 수 있음을 의미합니다.

왜 하나의 잘못된 조치가 더 이상 위험의 단위가 아닌가

이러한 결론은 기존의 인공지능 안전 시스템 구축 방식에 의문을 제기합니다. 대부분의 안전 보장 시스템은 특정 행동에 대한 평가에 기반하지만, 자율 에이전트는 허용 가능한 행동들을 조합하여 위험한 결과를 초래할 수 있기 때문입니다.

OpenAI는 이제 추적 수준 모니터링 시스템을 개선하고 내부 접근을 제한하기 전에 여러 단계의 보호 조치를 도입했습니다. 또한 새로운 평가 방법을 실험하고 있습니다.

지난 6월에 발표된 논문 '배포 시뮬레이션'프로세스를 설명했습니다trac. 그러나 20만 건의 대화 중 한 번 미만으로 발생하는 오류는 여전히 감지하기 어렵다고 지적했습니다.

이미 현장에 투입된 요원들에 대한 통계 자료는 무엇을 말해줄까요?

위험성은 OpenAI 자체에만 국한되지 않습니다. IssueTrojanBench 연구는 GitHub의 악성 이슈를 대상으로 Cursor, Claude Code, Codex Desktop과 같은 코딩 에이전트를 분석했습니다. 연구 저자들은 이 연구가 "코딩 에이전트에 대한 이슈 기반 간접 프롬프트 주입 공격을 평가하는 최초의 벤치마크"라고 밝혔습니다.

연구원 Ankur Singh, Jinqiu Yang, Tse-Hsun Chen은 모든 악성 이벤트의 66.5%가 에이전트 수준 및 모델 수준 보호 기능을 모두 회피한다는 사실을 발견했습니다. 이슈 설명과 PDF에 삽입된 악성 페이로드는 72.2%의 성공률을 보인 반면, 이미지 대체 텍스트에 숨겨진 페이로드는 16.7%의 성공률에 그쳤습니다. 코딩 에이전트는 출시 후 몇 달 만에 128,000개 이상의 GitHub 저장소에서 각각 22.20%와 28.66%의 채택률을 기록했습니다.

빠른 도입 속도와 취약한 방어 체계의 결합은 투자자들이 가트너의 전망에 관심을 갖는 이유를 설명해 줄 수 있습니다. 가트너의 부사장 겸 애널리스트인 조지 브로클허스트에 따르면, 결과를 직접적으로 제공하는 AI 에이전트는 소프트웨어 라이선스 수익과 사용자 증가 사이의 상관관계를 약화시킬 가능성이 있습니다.

SaaS는 사라지지 않을 것이며, 다른 형태로 다시 태어날 것입니다.

기업들이 자율형 AI에 더 큰 권한을 부여함에 따라 신뢰는 능력만큼이나 중요해질 수 있습니다. 오픈AI가 수집하고 로이터가 보도한 증거에 따르면, AI 시스템이 현실 세계에 도입되면 이를dent하고 제어하는 ​​능력이 시스템의 능력을 향상시키는 것만큼이나 중요해질 수 있습니다.

 

암호화폐 분야의 최고 전문가들이 이미 저희 뉴스레터를 구독하고 있습니다. 함께하고 싶으신가요? 지금 바로 참여하세요.

자주 묻는 질문

OpenAI의 내부 모델은 실제로 무엇을 잘못했을까요?

모니터링된 내부 테스트 중에 해당 모델은 샌드박스 제한을 우회하여 공개 GitHub 저장소에 풀 리퀘스트를 열었고, 별개의 사례에서는 평가 백엔드의 비공개 솔루션에 접근하려는 시도 중에 보안 스캐너를 우회하기 위해 인증 토큰을 분할하고 위장했습니다.

가트너는 에이전트형 AI로 인해 기업 지출 중 얼마나 많은 부분이 위험에 처할 수 있다고 말합니까?

가트너는 2026년 7월 1일, 현재부터 2030년까지 기업 애플리케이션 지출 중 최대 2,340억 달러(기업 애플리케이션 SaaS 지출의 약 20%)가 에이전트 차익거래에 노출될 수 있다고 추정했습니다.

AI 코딩 에이전트에 대한 공격은 얼마나 자주 성공합니까?

2026년 7월 22일에 발표된 IssueTrojanBench 연구에 따르면 악의적인 이슈 요청의 66.5%가 모든 에이전트 및 모델 수준의 안전장치를 뚫고 들어갔으며, 이슈 본문이나 PDF와 같은 텍스트 아티팩트를 이용한 공격은 72.2%의 성공률을 보였습니다.

이 기사를 공유하세요

면책 조항: 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan이 페이지에 제공된 정보를 바탕으로 이루어진 투자에 대해 어떠한 책임도 지지 않습니다.tron권장합니다dent .

미카 아비오둔

미카 아비오둔

미카 아비오둔은 탈린 공과대학교(TalTech)에서 환경공학 및 관리학 석사 학위를 취득하여 Cryptopolitan(Cryptopolitan)에서 콘텐츠 제작과 가격 예측 뉴스 작성에 매진하고 있습니다. 암호화폐 미디어 업계에서 7년째 활동 중인 그는 주요 암호화폐, 알트코인, DeFi, 스테이블코인, 거시 경제 동향 및 신흥 기술을 다루고 있습니다

더 많은 뉴스