AI '몸값 인하'… 앤트로픽·오픈AI, 프론티어 모델 가격 경쟁 본격화
앤트로픽은 안전성, 오픈AI는 실속 앞세우며 나란히 신모델 공개… "성능은 올리고 가격은 내린다"
[SNS 타임즈- LA] AI 전문 뉴스레터 '더 딥뷰(The Deep View)'가 최근 나란히 전한 소식에 따르면, 인공지능 업계를 이끄는 두 축인 앤트로픽과 오픈AI가 같은 날 나란히 신형 프론티어(최상위) 모델을 공개하며 성능과 가격을 동시에 끌어올리는 경쟁에 나섰다.
프론티어 모델이란 현재 기술 수준에서 가장 성능이 뛰어난 최신 인공지능 모델을 가리키는 업계 용어로, 두 회사 모두 이 최상위 모델의 몸값을 낮추면서도 기능은 강화하는 전략을 택했다는 공통점이 눈에 띈다.
먼저 앤트로픽은 화요일 자사의 대표 모델 '클로드' 시리즈의 최신판인 '오퍼스 5.5'를 선보였다.
이번 발표는 앤트로픽이 프론티어 모델 개발 속도 조절을 촉구하는 입장을 밝힌 지 며칠 만에 나온 것이어서 더욱 주목받았다. 회사 측은 오퍼스 5.5가 지금까지 내놓은 모델 가운데 '행동 정렬(behavioral alignment)' 측면에서 가장 뛰어난 성능을 보인다고 설명했다. 여기서 정렬이란 인공지능이 인간의 의도와 안전 기준에서 벗어나지 않도록 행동하게 만드는 기술을 뜻한다.
특히 눈에 띄는 대목은 안전장치 방식이다.
오퍼스 5.5는 사이버보안이나 생물학 관련 민감한 작업이 감지되면 해당 요청을 곧바로 거부하는 대신, 이전 세대 모델인 오퍼스 4.8이나 오퍼스 5로 자동 전환해 처리하도록 설계됐다.
이 가운데 오퍼스 5.5를 통해 관련 작업을 직접 수행할 수 있는 곳은 앤트로픽의 생명과학·사이버보안 검증 프로그램을 통과한 일부 기관으로 제한된다. 무조건적인 거부보다는 낮은 단계의 모델로 우회시키는 '완충 장치'를 택한 셈이다.
성능 면에서도 앤트로픽은 오퍼스 5.5가 에이전틱 코딩(AI가 스스로 여러 단계를 계획해 코드를 작성·실행하는 작업), 지식노동, 컴퓨터 조작, 시각 차트 인식 등 다양한 벤치마크에서 이전 세대인 오퍼스 5는 물론 자사의 '페이블 5.1'까지 앞섰다고 밝혔다.
벤치마크는 서로 다른 AI 모델의 성능을 동일한 기준으로 비교하기 위해 고안된 표준화된 시험을 뜻한다. 여기에 응답 속도는 오퍼스 5보다 30% 이상 빨라졌고, 문장 구성도 더 명료해져 핵심 정보를 답변 앞부분에 배치하도록 개선됐다는 설명이다.
무엇보다 시장의 관심을 끈 것은 가격이다.
오퍼스 5.5의 이용 요금은 전작 대비 최대 40% 낮아졌다. 입력 토큰(AI가 읽어들이는 텍스트 단위) 100만 개당 4달러, 출력 토큰 100만 개당 20달러로, 이는 오퍼스 5보다 20% 내린 수준이다. 다만 반복 작업에서 자주 쓰이는 '캐시 리드(이전에 처리한 내용을 다시 불러오는 기능)' 비용은 100만 토큰당 0.20달러로 오퍼스 5 대비 60%나 낮췄다.
앤트로픽은 프로·맥스·팀 등 유료 요금제의 5시간 사용 한도도 늘리기로 했으며, 조만간 더 저렴한 경량 모델인 '소네트'와 '하이쿠'의 5.5 버전도 선보일 예정이라고 덧붙였다.
경쟁사인 오픈AI도 화답하듯 신형 모델을 내놓았다.
자사의 최상위 모델 '아스트라' 출시 이후를 잇는 후속작으로 'GPT-6 솔'과 'GPT-6 루나'를 공개한 것이다. 오픈AI는 두 모델이 아스트라와 유사한 학습 방식을 거쳤으며, 사실 정확도와 코딩 능력, 컴퓨터 조작, 정렬 성능에서 진전을 이뤘다고 설명했다.
앞서 아스트라는 세계 최고 수준의 성능을 인정받았지만, 동시에 앤트로픽의 페이블 5.1과 함께 '가장 비싼 모델'이라는 꼬리표도 붙어 있던 터였다.
이번 신모델의 핵심 역시 가격 인하다.
GPT-6 솔과 루나는 전작 대비 토큰당 가격이 약 50% 저렴해졌다. GPT-6 솔은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러로, 이전 버전인 '5.6 솔'의 절반 수준이다.
보급형 모델인 GPT-6 루나는 입력 토큰 100만 개당 10센트, 출력 토큰 100만 개당 50센트에 불과해, 이전 세대보다 큰 폭으로 낮아졌다.
오픈AI는 여전히 아스트라를 '전 분야에서 가장 뛰어난 모델'이라 자평하면서도, GPT-6 솔이 업무 자동화 능력을 측정하는 '오토메이션벤치', 복잡한 에이전트 작업을 평가하는 '에이전츠 라스트 이그잼', 실제 코드베이스 기반 소프트웨어 엔지니어링 시험인 '딥스웨(DeepSWE) v1.1' 등 여러 벤치마크에서 앤트로픽의 오퍼스 5를 앞질렀다고 밝혔다.
아울러 두 모델 모두 아스트라의 간결한 소통 방식을 이어받아 불필요한 전문용어와 부차적인 정보를 줄였고, 경고 메시지를 우회하거나 코딩 과정에서 속임수를 쓰는 등의 부정 행위 비율도 이전 세대보다 뚜렷이 낮아졌다고 회사 측은 설명했다.
다만 GPT-6 솔과 루나는 현재 유료 요금제의 챗GPT 워크·코덱스 환경에서만 이용할 수 있고, 무료·일반 이용자는 데스크톱 앱에서 GPT-6 루나만 사용할 수 있어 일반 채팅 환경에는 아직 적용되지 않았다.
두 회사의 동시다발적 가격 인하 경쟁은 업계 흐름을 상징적으로 보여준다는 분석이 나온다.
기업들이 에이전틱 작업, 즉 AI가 여러 단계를 스스로 판단해 처리하는 업무에 갈수록 많은 토큰을 소비하게 되면서, 아무리 성능이 뛰어나도 비용 부담이 큰 모델을 꺼리는 경향이 뚜렷해지고 있기 때문이다.
오픈AI 입장에서는 저렴한 가격과 준수한 성능을 앞세워 기존의 선두 지위를 지키는 동시에, 최근 '제브(Jev)', '알로하제트(AlohaJet)', '패스웨이(Pathway)' 등 신생 업체들이 전통적인 확장 법칙(스케일링 로)을 위협하며 내놓은 혁신 기술에 맞서려는 포석으로 풀이된다.
앤트로픽 역시 겉으로는 안전과 정렬을 앞세웠지만, 결국 이번 발표도 치열한 경쟁 구도에서 자유롭지 않다는 지적이 나온다.
앤트로픽 CEO 다리오 아모데이는 최근 프론티어 AI 개발 속도 조절을 촉구하는 에세이에서 "그럼에도 발전은 여전히 빠르게 느껴질 것"이라고 언급한 바 있는데, 이번 오퍼스 5.5 출시는 이러한 발언과 묘한 대조를 이룬다는 평가다.
민감한 작업을 무조건 거부하는 대신 하위 모델로 우회시키는 안전장치 방식은, 위험도가 높은 작업을 완전히 차단하기보다는 시간을 버는 데 방점이 찍혀 있다는 해석도 나온다.
결국 두 회사 모두 '더 강하게, 더 저렴하게'라는 같은 목표를 향해 각기 다른 방식으로 속도를 내고 있는 모습이다.