ChatGPT 비교용 프롬프트 작성법: 모델 고를 때 바로 쓰는 템플릿

Photo of author

By 요담

ChatGPT 비교용 프롬프트 작성은 한 모델에게만 맞춰 답을 예쁘게 받는 작업이 아닙니다. 같은 업무를 ChatGPT와 Gemini, Claude에 나눠 줄 때는 문구와 컨텍스트, 첨부 파일까지 한 번에 고정해야 합니다. 모델 이름을 질문에 넣거나 모델마다 힌트를 바꾸면 순위가 왜곡됩니다.

테스트 도중에 한 모델만 고치면 비교는 무효가 됩니다. 아래에서는 평가 기준과 채점표를 프롬프트에 넣는 방법, 동일 조건 템플릿, 실무 복붙 예시를 순서대로 안내합니다. 새 대화에 같은 고정 문구만 붙여 넣은 뒤 답이 서로 새지 않게 하는 절차까지 함께 정리합니다.

비교용 프롬프트가 일반 질문과 다른 이유

클로드, ChatGPT, 제미나이 실전 비교 실험-같은 프롬프트, 다른 대답
(사진 출처: 네이버 블로그)

일반 질문은 한 모델의 답을 더 좋게 만드는 쪽으로 고칩니다. 비교용 프롬프트는 반대로 모든 모델에 동일 문구만 써야 하며 중간에 한 모델만 손보면 비교가 무효가 됩니다. 정답성, 지시 이행, 톤, 편집량을 같은 잣대로 보려면 태스크별 프롬프트를 테스트 전에 고정해야 합니다. 한 번 작성한 문구와 컨텍스트, 첨부만 반복합니다.

각 답을 이름이 가려진 문서에 복사한 뒤 새 대화에 동일 고정 프롬프트를 붙여 넣으면 앞 모델의 표현이 다음 모델로 새지 않습니다. 공식 웹에서 같은 날 같은 규칙으로 돌린 실측도 이 전제를 지킵니다. 첨부 구성이 달라지면 그 시점 이후의 점수는 같은 실험으로 묶지 않습니다.

비교 기준을 먼저 고정하는 프롬프트 설계

(출처: 머니그래프)

기본 모델을 정하기 전에 최소 세 가지 태스크 유형을 돌리십시오. 요약, 초안 작성, 표 정리처럼 성격이 다른 일을 고르면 한 유형에만 강한 모델을 기본값으로 고르는 실수를 줄입니다. 기준은 프롬프트 상단에 고정 문장으로 적고 테스트 중에 바꾸지 않습니다. 실제 업무 태스크 패킷과 동일 지시와 파일, 제약을 버전 고정하는 일이 유효한 비교의 출발점입니다.

실행 환경도 태깅합니다. 웹 UIAPI는 시스템 지시와 첨부 한도가 달라서 같은 문구라도 결과가 갈립니다. 버전과 날짜, harness를 기록해야 나중에 재현이 됩니다. 태스크 패킷의 파일 해시나 문서 버전을 프롬프트 헤더에 같이 적습니다.

평가 항목과 가중치 명시하기

사이드바이사이드 비교 스코어카드는 차원별 0, 1, 2점으로 없음, 부분, 강함을 매깁니다. 태스크 적합, 지시 충실, 사실 주의, 구조, 근거 사용을 넣으면 합계는 최대 20점이 됩니다. 가중치는 업무에 맞게 미리 적어야 채점자가 바뀌어도 순위가 흔들리지 않습니다. 창의성이 중요한 초안 업무면 해당 항목 가중치를 미리 높여 적습니다.

Promptfoo처럼 동일 테스트 케이스를 여러 프로바이더에 돌리면 통과율과 품질, 지연, 비용을 나란히 볼 수 있습니다. 출력은 비결정적이라 한 번의 통과만으로는 신뢰하기 어렵습니다. 동일 케이스를 프로바이더마다 반복 실행해야 변동을 잡을 수 있습니다.

동일 조건으로 ChatGPT·Gemini·Claude를 돌리는 작성 템플릿

역할, 목표, 입력, 제약, 금지, 출력 형식을 한 덩어리로 적습니다. ChatGPT와 Gemini, Claude에 붙여 넣을 때는 글자 하나도 바꾸지 마십시오. 날짜를 맞추고 공식 웹 인터페이스에서 같은 규칙으로 돌리면 환경 차이가 줄어듭니다. 모델명을 본문에 넣지 말고 채점 문서에만 남깁니다.

실측 비교에서는 같은 날 claude.ai, chat.openai.com, gemini.google.com에서 동일 10개 실무 프롬프트를 돌리고 정확성, 창의성, 명료성, 사용성으로 평가한 사례가 있습니다. 첨부 파일 이름과 버전 번호도 템플릿에 적어 두면 누락을 바로 찾습니다. 온도나 토큰 한도를 바꿀 수 있는 화면이면 그 값도 세 모델에 같게 맞춥니다.

입력·제약·금지사항을 한 덩어리로 묶기

입력을 본문 아래, 제약을 옆, 금지를 채팅으로 나눠 주면 모델마다 읽는 범위가 달라집니다. 원문, 분량 한도, 쓰지 말 표현, 출처 없는 숫자 금지를 한 블록에 모아야 동일 조건이 유지됩니다. 파일은 같은 사본만 올리고 파일명까지 템플릿에 적습니다. 시스템 지시가 있는 환경이면 그 문구도 공통 블록에 포함합니다.

답이 서로 새지 않게 하려면 모델마다 새 대화를 열고 같은 블록만 붙여 넣으십시오. 이전 답의 문장을 다음 프롬프트에 인용하면 후속 모델이 그 표현을 따라갑니다. 비교가 끝난 뒤에만 개별 모델을 위한 튜닝을 시작합니다. 블록 순서를 바꾸지 말고 역할, 입력, 제약, 출력 순을 유지합니다.

출력 형식·채점표까지 넣어야 결과가 갈리는 이유

자유 서술만 요청하면 한 모델은 긴 에세이를, 다른 모델은 짧은 목록을 줍니다. 길이와 형식이 다르면 정답성과 사용성을 같은 점수로 매기기 어렵습니다. 표 머리, 문단 수, 인용 규칙을 프롬프트에 명시해야 차이가 내용에서 드러납니다. JSON이나 지정 표만 허용하고 여분 설명을 금지하면 편집량 비교도 쉬워집니다.

채점 차원0점(없음)1점(부분)2점(강함)
태스크 적합목표와 무관일부만 충족업무에 바로 씀
지시 충실형식 미준수항목 일부 누락제약까지 준수
사실 주의없는 수치 생성확인 부족원문만 근거
구조두서없음칸은 있으나 혼재지정 형식 일치
근거 사용출처 없음일부만 연결인용과 대응

채점표를 출력 요구에 넣으면 모델이 자기 답을 항목별로 채워 줍니다. 사람이 0, 1, 2로 다시 매기는 루브릭과 항목 이름을 맞춰 두면 집계가 빨라집니다. 지시 이행이 약한 모델은 표 칸을 비우거나 형식을 깨는 지점에서 점수가 갈립니다. 형식을 지킨 뒤에만 사실과 누락을 채점하면 길이 편향을 줄입니다.

실무에서 바로 복붙하는 비교 프롬프트 예시

아래 문장을 그대로 복사해 세 모델에 붙이십시오. 역할은 사내 문서 편집자입니다. 목표는 회의록 초안을 800자 이내로 다듬는 일입니다. 입력은 원문 전체를 사용하고 추측 인원과 없는 일정은 적지 말며 출력은 결정 사항, 담당, 기한 세 칸 표로 맞춥니다.

채점 지시문도 같이 넣습니다. 태스크 적합, 지시 충실, 사실 주의, 구조, 근거 사용을 각 0점에서 2점으로 적고 합계와 한 줄 이유를 쓰라고 하십시오. 채점이 끝난 답만 가명 문서에 옮겨 순위를 매기면 모델명이 판단에 개입하지 않습니다. 같은 원문을 세 번 반복 실행해 변동이 큰 항목은 평균으로 봅니다.

금지 사항에는 모델 자화자찬과 출처 없는 수치를 넣습니다. 이 두 줄을 빼면 모델마다 군더더기 길이가 달라져 사용성 점수가 흔들립니다.

비교용 프롬프트 활용 정리

비교용 프롬프트는 한 번 작성해 고정한 뒤 모든 모델에 같은 문구와 첨부만 씁니다. 기준과 가중치, 출력 형식, 채점 차원을 같은 블록에 넣은 뒤에야 순위가 업무 기준으로 갈립니다. 웹 UI와 API를 섞지 말고 날짜와 버전을 기록하십시오. 가명 채점으로 정답성, 지시 이행, 톤, 편집량을 같은 순서로 봅니다.

최소 세 유형의 실무 태스크를 돌리고, 비결정적 변동을 보려면 케이스를 반복 실행합니다. 답이 새지 않게 새 대화만 사용하고 비교가 끝난 다음에만 모델별 튜닝을 시작하십시오. 이 절차를 지키면 ChatGPT 비교용 프롬프트 작성이 모델 선택의 기본 작업이 됩니다. 통과율과 지연, 비용을 같이 보면 기본 모델과 예외 업무를 나눌 수 있습니다.

요담

글쓴이

요담

AI를 실무에 활용할 수 있도록 도움드리는 요담입니다.