OpenAI의 Operator 에이전트, 새로운 AI 모델로 성능 향상

- OpenAI는 이전에 맞춤형 GPT-4o 버전을 사용하던 웹을 사용하여 작업을 수행하는 AI 에이전트인 Operator를 o3 기반 모델로 업그레이드했습니다.
- o3 Operator은 컴퓨터 사용에 대한 추가 안전 데이터, 특히 모델의 의사결정 경계를 가르치도록 설계된 안전 데이터셋으로 파인튜닝되었습니다.
- Arc Prize Foundation의 공동 설립자 중 한 명인 마이크 크누프는 o3 모델을 실행하는 것이 예상보다 비용이 더 많이 들 수 있다고 믿습니다.
OpenAI는 Operator를 구동하는 AI 모델을 이전의 맞춤형 GPT-4o 버전에서 OpenAI의 최신 '추론' 모델 시리즈인 o3 기반 모델로 업데이트했습니다. o3 Operator는 컴퓨터 사용에 대한 추가 안전 데이터로 파인튜닝되었으며, 모델의 결정 경계를 가르치도록 설계된 안전 데이터셋을 포함했습니다.
OpenAI 자금을 조달하는 목표를 ChatGPT의 Operator는 OpenAI o3 버전 기반의 새로운 컴퓨터 사용 에이전트(CUA) 모델과 함께 제공됩니다. 새로운 모델을 통해 Operator는 브라우저와 상호작용할 때 더 끈기 있고 정확해져 전체 작업 성공률이 향상되었습니다. 또한 더 명확하고 철저한 구조화된 응답도 제공합니다.
에 따르면 OpenAI, 새로운 CUA 모델은 업계 대비 더 강력한 성능을 보였으며, OSWorld 및 WebArena에서 SOTA(최고 성능)를 달성했습니다. 또한 기존 벤치마크와 인간 선호도 평가 모두에서 이전 버전 대비 더 강력한 상대 성능을 보였습니다.
OpenAI, GPT-4o 기반 모델을 o3 기반 버전으로 교체
OpenAI, ChatGPT Operator Agent에 대한 대규모 업그레이드 시사 pic.twitter.com/iGPQp9butD
— SabatAge (@sabatage) 5월 22일, 2025
OpenAI는 Operator의 기존 GPT-4o 기반 모델을 OpenAI o3 기반 버전으로 교체했지만, API 버전은 4o 기반을 유지할 예정입니다. AI 기업은 o3 Operator가 4o 버전과 동일한 다층 안전 접근 방식을 사용한다고 주장했습니다.
그러나 o3 패밀리 내 다른 모델들과 비교할 때, o3 Operator는 컴퓨터 사용에 대한 추가 안전 데이터로 파인튜닝되었으며, 여기에는 확인 및 거절에 대한 모델의 결정 경계를 가르치도록 설계된 안전 데이터셋이 포함됩니다.
OpenAI o3 Operator의 특정 안전성 평가에서의 성능을 보여주는 기술 보고서를 발표했습니다. GPT-4o Operator 모델과 비교할 때, o3 Operator는 ‘불법’ 활동 수행을 거부할 가능성이 적었고 민감한 개인 데이터를 검색할 가능성도 낮았으며, ‘프롬프트 인젝션’이라는 형태의 AI 공격에도 덜 취약했습니다.
“o3 Operator는 우리가 Operator의 4o 버전에서 사용했던 것과 동일한 다층 안전 접근 방식을 사용합니다…o3 Operator는 o3의 코딩 기능을 계승하지만, 코딩 환경이나 터미널에 대한 네이티브 접근 권한은 없습니다.”
AI 기업은 새로운 o3 기반 모델이 표준 안전 평가를 거쳤으며, Operator가 전 세계 ChatGPT Pro 사용자를 대상으로 연구용 미리보기로 계속 제공될 것이라고도 밝혔습니다. 그러나 이 업그레이드된 모델은 ChatGPT의 Operator에서만 사용 가능합니다.
Knoop, OpenAI의 o3 모델 실행이 예상보다 비용이 많이 들 수 있다고 의심
지난주 ARC-AGI를 유지하고 관리하는 Arc Prize Foundation은 o3의 대략적인 컴퓨팅 비용을 업데이트했습니다. 해당 조직은 처음 테스트한 o3 중 가장 성능이 좋은 구성인 o3 high가 단일 ARC-AGI 문제를 해결하는 데 약 $3,000이 든다고 추정했습니다. 그러나 현재 재단은 비용이 이전 추정치의 10배인 작업당 약 $30,000에 이를 수 있다고 믿고 있습니다.
또한 OpenAI는 아직 o3의 가격을 책정하거나 완전히 출시하지 않았지만, Arc Prize Foundation의 공동 설립자 중 한 명인 Mike Knoop은 o1-pro 모델 가격이 o3의 실제 비용에 대한 합리적인 대리 변수이자 더 가까운 비교 대상이라고 믿고 있습니다. 그는 그러나 공식 가격 발표 전까지의 불확실성을 반영하기 위해 o3는 리더보드에서 계속 '미리보기'로 표시될 것이라고 덧붙였습니다.
Arc Prize Foundation에 따르면, 모델이 reportedly 사용하는 컴퓨팅 자원의 양을 고려할 때 o3 high의 높은 가격이 전혀 이상할 것은 아닙니다. o3 high는 o3의 가장 낮은 컴퓨팅 구성인 o3 low보다 172배 더 많은 컴퓨팅을 사용하여 ARC-AGI를 해결했습니다.
루머가 돌고 있었습니다. 3월 초부터 OpenAI가 기업 고객을 위해 도입할 것으로 예상되는 고가의 요금제에 대한 소문이 나왔습니다. 보도된 정보에 따르면, 회사는 소프트웨어 개발자 에이전트와 같은 전문화된 AI ‘에이전트’에 대해 월 최대 2만 달러를 청구할 수 있다고 합니다.
그러나 일부는 OpenAI의 가장 비싼 모델조차 일반적인 인간 계약자나 직원보다 훨씬 저렴할 것이라고 주장한 반면, AI 연구자 토비 오드는 모델이 그렇게 효율적이지 않을 수 있다고 지적했습니다. 예를 들어, o3 high는 ARC-AGI의 각 작업에서 최고 점수를 달성하기 위해 1,024번의 시도가 필요했습니다.
이 글을 읽고 계신다면, 이미 앞서 나가고 있습니다. 뉴스레터로 그 위치를 유지하세요.

Collins J. Okoth
콜린스 오코트는 암호화폐와 기술을 8 년간 보도해 온 저널리스트이자 시장 분석가입니다. 그는 공인 재무 분석가 (CFA) 자격을 보유하고 있으며 정량 수학 학위를 소지하고 있습니다. 콜린스는 이전에 Geek Computer 와 CoinRabbit 에서 작가 및 편집자로 일했습니다.















