실험

AI 업무 자동화, 어떤 모델에 맡길까: 실제 작업 11개로 GPT 루나와 클로드 하이쿠 비교

읽는 데 약 6분#실험#AI 업무 자동화#GPT 루나#GPT-6 Luna#클로드 하이쿠#Claude Haiku 5.5#AI 모델 비교#GPT 클로드 비교#LLM 벤치마크#클로드 코드#코덱스#Aside 브라우저

이 글의 독자다이어그램, 문서, 블로그 초안, 브라우저 작업 같은 반복 업무를 AI에 맡기려는데, 싼 모델로도 쓸 만한 결과물이 나오는지 비용과 함께 알고 싶은 직장인과 1인 사업자

한줄 요약: 다이어그램, 슬라이드, 문서, 블로그 초안, 브라우저 작업까지 실제 업무 11가지를 모델 5개에 3번씩 맡겼습니다. 정해 둔 규격은 하이쿠 5.5와 소넷 5.5가 33번 모두 지켰고, 비용은 하이쿠 5.5가 소넷의 약 12.6분의 1이었습니다. 반대로 그림, 차트, 문서를 모델 이름을 가리고 사람이 채점한 점수(평가자 1명)는 가장 싼 GPT-6 Luna가 가장 높았습니다. 규격을 스크립트로 검사하는 자동화라면 하이쿠 5.5, 사람이 다듬을 시각 결과물 초안이라면 GPT-6 Luna가 이 실험에서 가장 경제적이었습니다.

목차

  1. 작은 과제에서는 비슷했던 두 모델
  2. 실험 설계
  3. 결과: 기계 채점과 사람 채점이 갈렸다
  4. 어떤 상황에 무엇을 고르나
  5. 결과물 나란히 보기
  6. 틀린 장면들
  7. 비용, 시간, 성능
  8. 이 실험의 한계
  9. 정리

1. 작은 과제에서는 비슷했던 두 모델

앞선 실험에서는 발표문 추출, 문의 분류, 코드 수정 같은 작은 판정 과제 6개로 하이쿠 5.5와 GPT 루나를 비교했습니다. 6과제 중 4과제가 다섯 모델 모두 만점이라, 하이쿠 5.5와 GPT-6 Luna의 점수 차이를 가를 수 없었습니다.

이번에는 질문을 바꿨습니다. 실제로 반복해서 맡기는 일, 그러니까 결과물이 그림이고 문서이고 브라우저 조작인 일에서도 같은가입니다.

  • 과제는 지난 90일 동안 필자가 AI에 맡긴 대화 334건을 작업 종류별로 세어, 자주 하는 일 위주로 골랐습니다.
  • 카드뉴스는 4건뿐이라 뺐습니다.
  • 모델은 앞선 실험과 같은 다섯 개입니다. 클로드 하이쿠 5.5, 하이쿠 4.5, 소넷 5.5, GPT-6 Luna, GPT-5.6 Luna.

2. 실험 설계

모델마다 그 회사의 에이전트 도구로 돌렸습니다. 클로드는 클로드 코드(claude -p), GPT는 코덱스(codex exec), 브라우저 작업은 두 회사 모델을 모두 연결할 수 있는 Aside 브라우저입니다.

P대상
실제 업무 11가지: 시각 결과물 5, 글쓰기 3, 브라우저 작업 3
I바꾼 것
모델 5개: Claude Haiku 5.5, Haiku 4.5, Sonnet 5.5, GPT-6 Luna, GPT-5.6 Luna
C비교 기준
GPT-6 Luna, 다섯 모델 중 가장 싼 모델
O잰 것
기계 채점(100점), 사람 채점(5점, 시각 과제), 비용(API 환산 달러), 시간(초)
T기간과 횟수
2026년 10월 8일, 과제마다 3회, 모두 165회
통제 못 한 것
사람 채점은 평가자 1명, 모델마다 실행 도구가 다름, 과제 문구는 클로드(Opus 5.5)가 씀
같은 과제 파일, 같은 지시문, 추론 강도 medium, 개인 설정을 뺀 빈 환경으로 고정했습니다.
트랙 과제 기계 판정
시각 다이어그램(흐름도) 노드와 연결선, 글자 겹침, 선이 글자를 지나가는지
시각 강의 슬라이드 5장 장 밖 넘침, 최소 글자 크기, 개조식 문장
시각 웹페이지 한 장 휴대폰 폭 가로 스크롤, 버튼 높이, 필수 요소
시각 데이터 차트 점 48개의 값, 값과 높이가 맞는지
시각 대외 문서(PDF) 쪽수, 낱말 중간 줄바꿈, 원문에 없는 숫자
글쓰기 Threads 글 글자 수, 링크 위치, 말투, 원문에 없는 숫자
글쓰기 블로그 초안 이 블로그의 발행 게이트 통과 여부
글쓰기 웹 리서치 공식 문서 값 5개와 출처
브라우저 검색, 쇼핑 비교, 예약 폼 정답 값과 제출된 값 대조
  • 시각 과제는 실제 브라우저로 띄워 글자 하나하나의 위치와 크기를 쟀습니다.
  • 비용은 Anthropic과 OpenAI 공식 가격표(10월 8일 확인)로 계산했습니다. 실험은 구독으로 돌려 실제 청구는 없었으니, 모든 비용은 API였다면 든 비용입니다.
블라인드 평가 화면. 다이어그램 과제 아래 산출물 A부터 D까지 흐름도 네 장이 나란히 있고, 각 그림 아래 1부터 5까지 점수 버튼과 못 씀, 그대로 씀이라는 눈금이 있다
평가 화면에서는 모델 이름 대신 A부터 E까지 기호만 보입니다.

3. 결과: 기계 채점과 사람 채점이 갈렸다

모델 규격 점수 만점 회차 사람 채점 점수 11과제 비용 11과제 시간
Claude Haiku 5.5 100.0 33/33 3.8 $0.117 365초
Claude Sonnet 5.5 100.0 33/33 3.6 $1.473 297초
Claude Haiku 4.5 96.9 20/33 2.6 $1.136 723초
GPT-5.6 Luna 96.7 23/33 3.8 $0.125 334초
GPT-6 Luna 92.5 19/33 4.6 $0.044 281초
기계 채점과 사람 채점을 위아래 두 패널의 점 그래프로 놓은 그림. 기계 채점(100점 만점, 가로축 88~100)은 Haiku 5.5 100.0, Sonnet 5.5 100.0, Haiku 4.5 96.9, GPT-5.6 Luna 96.7, GPT-6 Luna 92.5. 사람 채점(5점 만점)은 GPT-6 Luna 4.6, Haiku 5.5 3.8, GPT-5.6 Luna 3.8, Sonnet 5.5 3.6, Haiku 4.5 2.6
기계 채점 꼴찌인 GPT-6 Luna가 사람 채점은 가장 높았습니다. 기계 채점 축은 88점부터 그렸습니다.
  • 하이쿠 5.5와 소넷 5.5는 11과제 33번을 모두 규격대로 끝냈습니다.
  • GPT-6 Luna는 규격을 가장 많이 어겼지만(33번 중 14번), 사람 채점 점수는 4.6으로 가장 높았습니다.
  • 브라우저 작업만 보면 GPT-6 Luna를 뺀 네 모델이 9번 모두 만점이었습니다.

4. 어떤 상황에 무엇을 고르나

어떤 상황에 무엇을 고르나. 규격을 스크립트로 검사하는 자동화라면 Haiku 5.5, 규격 33회 모두 통과, 비용은 소넷의 12.6분의 1. 아니면 사람이 다듬을 그림, 차트, 문서 초안이고 가장 싸야 한다면 GPT-6 Luna, 사람 채점 점수 4.6(평가자 1명), 0.044달러, 규격은 직접 확인. 아니면 하이쿠 4.5로 돌리는 일이 있다면 Haiku 5.5로 옮기기, 만점 20회에서 33회로, 비용 약 10분의 1. 모두 아니면 내 일로 직접 재 보기, 과제 11개를 3번씩 잰 작은 실험이다
규격을 검사하는 자동화와 사람이 다듬을 시각 결과물 초안을 갈라서 골랐습니다. 사람 채점 점수는 평가자 1명 기준입니다.
  • 권하지 않는 경우: 시각 결과물에 하이쿠 4.5를 쓰는 것. 15번 중 4번만 규격을 통과했고 사람 채점 점수는 2.6이었습니다.
  • 규격을 검사하는 자동화에서 소넷 5.5는 하이쿠 5.5와 규격 결과가 같고 비용만 약 12.6배였습니다.
  • GPT-6 Luna는 글쓰기 과제(웹 리서치 포함)에서 다섯 모델 중 규격 점수가 가장 낮아, 글 초안에는 이 추천을 넓히지 않았습니다.

5. 결과물 나란히 보기

아래 그림은 1회차 결과물에 규격 점수와 사람 채점 점수를 함께 단 것입니다.

다이어그램 과제 다섯 모델의 결과물. Haiku 5.5 기계 채점 100점 사람 채점 5점, Sonnet 5.5 기계 채점 100점 사람 채점 4점, Haiku 4.5 기계 채점 92점 사람 채점 1점으로 화살표가 노드와 떨어져 왼쪽에 흩어져 있다. GPT-6 Luna 기계 채점 92점 사람 채점 4점으로 되돌아가는 선이 치명 지적 글자를 지나간다. GPT-5.6 Luna 기계 채점 92점 사람 채점 2점으로 굵은 화살촉이 노드 사이를 덮고 곡선이 FAIL 글자를 지나간다
하이쿠 4.5 그림은 화살표가 노드와 떨어져 있는데도 규격 점수는 92점이었습니다.
  • 하이쿠 5.5의 흐름도는 규격과 사람 채점 점수 모두 만점이었습니다.
  • 하이쿠 4.5의 흐름도는 화살표가 노드 왼쪽에 따로 흩어져 1점을 받았습니다. 연결선마다 어느 노드를 잇는지 표시는 달려 있어서, 기계 채점은 이 결함을 잡지 못했습니다.
데이터 차트 과제 다섯 모델의 결과물. 채널 4개의 월별 방문 수 꺾은선 차트로, Haiku 5.5, GPT-6 Luna, GPT-5.6 Luna는 사람 채점 5점, Sonnet 5.5와 Haiku 4.5는 사람 채점 2점이다. Haiku 4.5 차트는 선이 그래프 위로 넘친다
숫자가 모두 맞은 소넷 차트도 사람 채점 점수는 2점이었습니다.
대외 문서 과제 다섯 모델의 과정소개서 PDF. Haiku 5.5와 Sonnet 5.5는 2쪽짜리로 각각 사람 채점 2점과 3점, Haiku 4.5, GPT-6 Luna, GPT-5.6 Luna는 1쪽짜리로 모두 사람 채점 5점이다
1쪽으로 정리한 문서 셋이 모두 5점을 받았습니다.

6. 틀린 장면들

규격 점수가 깎인 자리는 모델마다 달랐습니다.

모델 주로 깎인 자리 (과제마다 실행 3번 중 감점된 횟수)
GPT-6 Luna 흐름도 선이 글자를 지나감 3번, 웹 리서치 3번(빈칸 3개, 오답 2개), 쇼핑 비교 2번
GPT-5.6 Luna 흐름도 선이 글자를 지나감 2번, 슬라이드 글자 겹침 2번, 웹 리서치 3번(빈칸 2개, 오답 1개)
Claude Haiku 4.5 휴대폰 화면 14px 미만 글자 3번, 슬라이드 28px 미만 글자 2번, 흐름도 선 2번

웹 리서치에서 GPT-5.6 Luna의 출력 단가(공식 $1.20)를 GPT-6 Luna는 3번 중 2번, GPT-5.6 Luna 자신도 1번 $0.60으로 적었습니다.

"q2": {"answer": "0.60", "source_url": "https://developers.openai.com/api/docs/pricing"}

(GPT-6 Luna, 웹 리서치 2회차 답 파일)

  • 두 루나 모델은 “클로드 코드에서 하이쿠 5.5를 쓰려면 필요한 최소 버전”을 찾지 못했을 때 지어내지 않고 빈칸으로 남겼습니다. 지시대로입니다.
  • 쇼핑 비교의 GPT-6 Luna 오답 2번은 앞선 Aside 실험에서 틀린 것과 같은 과제였습니다.

7. 비용, 시간, 성능

비용, 시간, 성능을 한 장에 놓은 산점도. 가로축은 11과제 한 바퀴 비용으로 로그 눈금을 반대로 놓아 오른쪽일수록 싸고, 세로축은 기계 채점. 오른쪽 위 싸고 정확한 쪽 영역에는 Haiku 5.5(0.117달러, 365초, 100점)만 있다. Sonnet 5.5는 1.473달러, 297초, 100점으로 왼쪽 위. GPT-5.6 Luna는 0.125달러, 334초, 96.7점. Haiku 4.5는 1.136달러, 723초, 96.9점. GPT-6 Luna는 0.044달러, 281초, 92.5점으로 오른쪽 아래
비용축을 반대로 놓아 오른쪽 위가 좋은 쪽입니다(Artificial Analysis의 가격축 표기 방식). 색칠한 영역은 한 바퀴 $0.3 미만에 98점 이상입니다. 그 안에 든 하이쿠 5.5만 강조색으로 칠했습니다.
  • 하이쿠 4.5는 하이쿠 5.5보다 약 10배 비쌌습니다. 입력, 캐시, 출력 단가가 모두 하이쿠 5.5의 10배입니다.
  • 시간은 GPT-6 Luna(281초)와 소넷 5.5(297초)가 가장 짧았고, 하이쿠 4.5(723초)가 가장 길었습니다.
  • 소넷 5.5의 차트 2회차 한 번은 실행 도중 도구가 멈췄다가 다시 시작되어 비용 기록이 빠졌습니다. 그 한 번은 다시 돌린 값으로 바꿨습니다.

8. 이 실험의 한계

  • 사람 채점 점수는 평가자 1명이 시각 과제마다 1회차 결과물 한 벌씩만 봤습니다. 모델마다 점수 5개라, GPT-6 Luna 4.6과 하이쿠 5.5 3.8의 차이도 합계 4점 차이입니다. 글쓰기와 브라우저 과제에는 사람 채점 점수가 없습니다.
  • 기계 채점은 규격만 잽니다. 하이쿠 4.5의 흐름도처럼 연결 표시는 맞는데 화살표가 떨어져 있는 결함은 놓쳤습니다.
  • 채점기를 검산하다 버그 두 개를 고치고 다시 채점했습니다. 웹 검색 답의 첫 숫자만 보던 것과, 문서 과제의 “2쪽 이내”를 “정확히 2쪽”으로 판정하던 것입니다.
  • 모델과 실행 도구를 묶어 쟀습니다. 같은 모델을 API로 직접 부르면 결과와 비용이 달라질 수 있고, 이번에는 재지 않았습니다.
  • 추론 강도는 medium 하나로만 쟀습니다. 두 회사의 medium이 같은 수준이라는 보장은 없습니다.

9. 정리

  • 같은 모델이라도 “규격을 지켰나”와 “보기 좋은가”는 다른 결과를 냈습니다. 둘 다 재야 고를 수 있습니다.
  • 하이쿠 4.5를 쓰고 있다면 하이쿠 5.5로 옮겨 규격 통과와 비용을 함께 개선할 수 있었습니다.

자주 묻는 질문

AI 업무 자동화에는 GPT 루나와 클로드 하이쿠 중 무엇이 낫나요?
실제 업무 11가지를 3번씩 맡긴 이 실험에서, 정해 둔 규격을 지켰는지는 Claude Haiku 5.5가 33번 모두 통과했고 GPT-6 Luna는 19번 통과했습니다. 반대로 시각 과제 5개를 모델 이름을 가리고 매긴 사람 채점 점수(5점 만점, 평가자 1명)는 GPT-6 Luna가 4.6으로 가장 높고 Haiku 5.5는 3.8이었습니다. 비용은 11과제 한 바퀴에 GPT-6 Luna 0.044달러, Haiku 5.5 0.117달러였습니다(2026년 10월 8일 실측).
클로드 하이쿠 5.5와 소넷 5.5는 업무 결과가 얼마나 다른가요?
이 실험에서는 두 모델 모두 11과제 33번을 전부 규격대로 끝냈습니다. 비용은 한 바퀴에 하이쿠 5.5가 0.117달러, 소넷 5.5가 1.473달러로 하이쿠 5.5가 약 12.6분의 1이었습니다.

댓글

    핀번호는 내 댓글을 지울 때 필요합니다.

    뉴스레터

    새 글을 메일로 받아보세요

    AI 자동화 튜토리얼과 저자 코멘터리를 보냅니다. 스팸 없이, 새 글이 올라올 때만.

    구독하기 ›