애플의 업그레이드된 AI 모델이 경쟁사 대비 저조한 성능

- 애플은 어제 iOS, macOS 및 iPadOS 전반에 걸쳐 Apple Intelligence 스위트 기능을 powering하는 AI 모델의 업데이트를 발표했다.
- 해당 모델은 Apple의 벤치마크에서 OpenAI를 포함한 경쟁사의 이전 모델보다 성능이 떨어졌습니다.
- 기술 거대 기업은 온디바이스 및 Apple 서버가 개선되어 15개 이상의 언어를 더 잘 이해할 수 있다고 주장했습니다.
애플은 어제 WWDC 2025에서 지능형 스위트 전반에 걸쳐 적용될 AI 모델의 향후 업데이트를 발표했다. 이 모델은 OpenAI와 같은 경쟁사의 이전 모델과 비교했을 때 벤치마크에서 저조한 성능을 보였다. 그러나 이 기술 거주는 온디바이스 및 애플 서버가 전작 대비 개선되었으며 15개 이상의 언어를 이해할 수 있다고 주장했다.
인간 테스트러들에 따르면, 아이폰 및 기타 기기에서 로컬로 실행되는 최신 온디바이스 모델은 텍스트 생성 측면에서 Google과 Alibaba의 이전 모델과 유사한 성능을 보였다. 인간 테스트러들은 회사의 데이터 센터에서 실행하도록 설계된 애플 서버를 OpenAI의 1년 된 GPT-4o보다 뒤처지는 것으로 평가했다. 별도의 평가에서는 Meta의 Llama 4가 이미지 분석 능력에서 애플 서버보다 우월한 것으로 나타났다. 이 평가 결과는 Apple이 놀랐던 이유는 램다 4 Scout가 Google, Anthropic, OpenAI와 같은 AI 연구소들과 비교했을 때 저조한 성능을 보였기 때문이다.
개발자들은 애플의 혁신 약속에 대해 회의적인 시각
개발자들은 부정적으로 올해의 WWDC 발표들, 특히 애플의 작은 온디바이스 AI 모델에 대해 부정적인 반응을 보이고 있다. AI 기반 개인 금융 앱 Origi의 최고 제품 책임자인 Atul Kakkar는 개발자로서 Tim Cook의 회사가 발표한 것에 대해 큰 흥분을 느끼지 못했다고 밝혔다. 그는 매년 열리는 WWDC 행사가 한때 기술계에서 가장 화제가 되는 행사였다고 믿지만, 이제 아이폰 제조사가 AI 거인들과 경쟁할 수 있을지에 대한 회의론에 휩싸여 있다고 생각한다.
Apple은 자사 AI에 대한 벤치마크를 공개하지 않으며, 문서화가 미흡한 직접 비교 평가 결과만 발표합니다.
하지만 Apple의 기준조차도 최신 온디바이스 모델은 Google의 오픈 소스 Gemma 3-4B나 Qwen 3-4B보다 대체로 열등합니다.
그리고 그들의 서버 LLM은 Llama 4 Scout pic.twitter.com/hwpOG5Lgyp와 유사합니다
— Ethan Mollick (@emollick) 6월 10, 2025
이 기술 거주는 개발자를 위한 AI 도구를 지속적으로 업데이트하고 Apple Intelligence 스위트 내에서 흥미로운 소비자 경험을 구축함으로써 경쟁력을 유지해야 한다는 압박을 받고 있다. AI 기반 육아 조언 앱 Bobo의 최고 경영자이자 공동 창립자 Grant McDonald는 Tim Cook의 회사가 흥미로운 일을 하고 있지만, 소음을 뚫고 나가기에는 충분하지 않다고 말했다.
McDonald는 개발자들이 온디바이스 소형 AI 모델을 사용하여 AI 기반 애플리케이션을 구축할 수 있게 하는 것이 회사가 전달하고자 하는 가치일 수 있다고 믿는다. 소형 AI 모델은 작은 데이터셋으로 학습하며 컴퓨팅 파워를 적게 사용하므로 클라우드의 대형 서버 대신 아이폰에서 실행할 수 있다. 그는 기기간 모델 실행이 GPT 및 Gemini와 같은 클라우드 기반 모델보다 실질적으로 저렴하다고 말했다.
개발자들은 온디바이스 모델이 클라우드 기반 모델 대비 잘 작동할 수 있다는 점을 의심해 왔다. 한 개발자는 자체 데이터셋으로 파인튜닝할 수 없을 것이라고 말했다. McDonald는 온디바이스 모델이 일부 앱에는 충분하겠지만 Bobo에는 적합하지 않을 것이라고 말했다. 이 육아 앱은 수면 상담사, 모유 수유 상담사, 언어 치료사 및 기타 육아 전문가로부터의 자체 데이터를 사용하여 AI 모델을 맞춤화했다.
애플의 AI 연구 부문이 경쟁사들을 따라잡는 데 어려움을 겪고 있다
이 기술 거주는 더 개인화된 콘텐츠를 특징으로 하는 Siri 업그레이드를 약속했지만, 이 업그레이드는 지연되고 있다. 일부 고객사는 아직 제공되지 않은 제품을 마케팅했다는 이유로 회사를 고소했다. 연구원들은 AI 모델이 수학 및 과학 분야에서 매우 잘 작동하지만, 복잡한 문제는 단지 사고의 환상을 제공할 뿐이라고 말했다.
이 기술 거주는 대화에서 배제되기 위해 대형 언어 모델 개발과 기기에서의 AI 구현을 지연시켰다. At WWDC, 회사는 커뮤니티가 실망스러운 것으로 간주한 AI 기능인 Apple Intelligence를 발표했다.
연구원들은 알아냈다 LRM(대규모 추론 모델)은 특정 지점 이후에 실패하기 시작한다. 이는 모든 추론 모델이 문제의 복잡성이 증가함에 따라 정확도가 점진적으로 감소하여 결국 0%에 도달하는 유사한 패턴을 보인다는 것을 보여준다. 연구원들에 따르면, 추론 모델은 초기에는 더 많은 사고 토큰을 적용하지만, 복잡성이 증가함에 따라 포기하며, 역설적으로 문제 난이도가 증가함에도 불구하고 추론 노력이 감소하기 시작한다.
Forrester Research Analyst인 Dipanjan Chatterjee에 따르면, Siri 주변의 침묵은 귀를 찢을 듯했다. 그는 텍스트 수정이나 귀여운 이모티콘이 Siri가 가능할 것으로 알려진 기대되는 상호작용형 AI 경험을 채울 수 없다고 밝혔다. 그는 회사가 빠르게 행동하지 않으면 Siri의 종말이 가까워질 것이라고 믿는다. 회사는 Siri 업그레이드에 대한 정확한 일정을 제공하지 않았다. 그러나 Craig Federighi, 회사의 최고 소프트웨어 임원은 가장 빠르면 내년이 되어야 가능할 것이라고 시사했다.
가장 똑똑한 암호화폐 전문가들이 이미 우리 뉴스레터를 구독하고 있습니다. 참여하고 싶으신가요? 함께하세요.

Collins J. Okoth
콜린스 오코트는 암호화폐와 기술을 8 년간 보도해 온 저널리스트이자 시장 분석가입니다. 그는 공인 재무 분석가 (CFA) 자격을 보유하고 있으며 정량 수학 학위를 소지하고 있습니다. 콜린스는 이전에 Geek Computer 와 CoinRabbit 에서 작가 및 편집자로 일했습니다.















