반론과 한계
최고 설정의 실패, 비용 폭증, 경쟁 모델이 나았던 경우.
8가지반론과 한계
최고 설정의 실패, 비용 폭증, 경쟁 모델이 나았던 경우.
8가지최고 설정의 실패, 비용 폭증, 경쟁 모델이 나았던 경우.
콘텐츠에 한두 줄 같이 쓰면 "광고 같다"는 반응을 줄일 수 있는 기록이다. 모두 원문 링크를 붙였다.
Simon Willison의 펠리컨 그림 시험에서 max 강도는 출력 한도 12만 8천 토큰을 생각하는 데 다 쓰고 답을 못 냈다(두 번, 회당 약 2.56달러·20분). 같은 조건의 Fable 5.1은 성공했다. playcode.io도 같은 현상을 재현했고, 한 단계 낮은 xhigh는 1.72달러로 Fable 5.1과 비슷한 품질을 냈다.
Artificial Analysis 기준 작업당 비용이 low 0.55달러, medium 1.34달러, high 1.82달러, xhigh 3.46달러, max 5.98달러다. max는 Opus 5 max(5.86달러)와 비슷해서, "40% 저렴"은 기본 설정 기준이라는 점을 밝혀야 한다.
3D 장면 4개 비교에서 Opus 5.5는 4.37달러, GPT-6 Sol은 0.34달러였다(결과물은 Opus 쪽이 더 촘촘). 정답 하나당 실제 비용으로 계산하면 Sol이 3.4배 싸다는 분석도 있다.
총점 Sol 237점, Opus 5.5 221점(250점 만점). 디자인은 Opus가 5판 중 4판을 이겼지만 속도는 Sol이 전승했다(43분 대 77분). Opus가 테스트 정리 중 컴퓨터의 파이썬 프로세스를 모두 꺼 버려 녹화가 끊긴 일도 적혀 있다.
같은 그림 과제에서 Opus 5.5는 사용량이 2,000 AIU(Astra의 378 AIU가 3.78달러였던 단위)를 넘겨 작성자가 중단시켰고, Fable 5.1은 811, Sol은 126이었다. medium 강도로는 약 180 AIU였다는 댓글이 붙었다.
원샷 게임 게시물의 상위 댓글은 "실제로 해 보면 버그투성이", "이건 원샷한 게 아니다"였다. 작은 행성 게시물에는 "차량이 궤도를 벗어나는 버그" 지적이 달렸다.
디자인 이미지를 HTML로 옮긴 비교에서 페이지 전환 애니메이션 지시를 무시했고, 네 모델 중 로딩이 가장 느렸다는 후기.
"Opus 5도 출시 때 Fable 5급이라더니 실제론 대화도 잘 안 됐다"는 댓글이 202표를 받았다.
