n8n이 9월 21일 공개한 프롬프트 테스트 가이드는 형식이 맞는 답과 업무에 맞는 답을 구분합니다. 분류 결과가 JSON으로 잘 나와도 잘못된 담당자에게 보내면 실패입니다. 우리 팀의 평가표를 엑셀 20줄로 만들어 보겠습니다.
어제는 답을 잘하던 AI가 오늘은 중요한 조건을 빠뜨립니다. 그때마다 다른 모델로 바꾸기 전에, 우리 업무에서 자주 나오는 질문을 엑셀 한 장에 모아 보세요. 거창한 평가 도구가 없어도 비교 기준이 생깁니다.
예시는 문의 메일 분류입니다. 쉬운 문의만 넣으면 어느 후보든 좋아 보일 수 있으므로, 아래처럼 20개를 구성해 보겠습니다. 이 비율은 시작을 돕는 예시이며 공식 성능 시험의 표준은 아닙니다.
| 문항 묶음 | 개수 | 준비할 내용 |
|---|---|---|
| 정상 문의 | 10 | 영수증, 비밀번호, 기능 사용법처럼 뜻이 분명한 문의 |
| 두 문제가 섞인 문의 | 4 | 결제 후 로그인도 안 된다는 문의 |
| 정보가 빠진 문의 | 4 | 주문번호 없이 취소해 달라는 문의 |
| 처리 범위 밖 요청 | 2 | 권한 없는 자료를 달라는 요청 |
정답은 AI에게 묻기 전에 적으세요
“결제는 됐는데 팀원은 못 들어가요”의 기대 결과를 ‘복합 문의, 담당자 검토’라고 먼저 정합니다. 답변을 본 뒤 정답을 바꾸면 좋아 보이는 모델에 맞춰 기준이 흔들릴 수 있습니다. 팀원끼리 의견이 갈리는 문항은 정답보다 업무 규칙을 먼저 정리할 신호입니다.
엑셀 열 구성 문항 ID / 문의 원문 / 기대 분류 / 후보 A 결과 / 후보 B 결과 통과 여부 / 틀린 이유 / 사람이 고친 시간(분)
채점은 단순하게 시작하세요. 기대한 분류이고 필요한 추가 질문이 있으면 통과, 틀린 분류나 없는 주문번호를 만들면 실패입니다. 친절한 말투 같은 선호는 사실 오류와 다른 칸에 적어야 결과를 읽기 쉽습니다.
점수보다 실패한 네 줄을 먼저 읽으세요
가령 두 후보가 모두 20개 중 18개를 통과했다고 해 봅시다. 한 후보는 단순 분류 두 개를 놓쳤고, 다른 후보는 처리 권한이 없는 요청 두 개를 실행하려 했습니다. 숫자는 같아도 업무에 미치는 영향은 다릅니다. 이 예시는 설명용이며 실제 모델 측정 결과가 아닙니다.
개인정보나 발송과 연결되는 실패는 별도 열로 표시하고, 해결 전에는 자동 처리 범위를 넓히지 마세요. 애매한 사례를 담당자에게 넘기는 답도 업무 기준에 맞으면 성공입니다. 모든 질문에 단정적으로 답하는 것이 목표가 아닙니다.
한 번 통과했다고 표를 버리지 마세요
지시문을 고쳤거나 모델을 바꿨다면 같은 20개를 다시 실행해 보세요. 답이 흔들리는 문항은 반복해서 살펴보고 실패 기록을 남깁니다. 새 문제가 나오면 기존 문항을 지우기보다 사례를 추가하세요. 이렇게 만든 표는 우리 팀의 작은 회귀 검사 목록이 됩니다.
OpenAI의 평가 안내도 업무에 맞는 기준과 반복 평가를 강조합니다. 비교 기록에는 실제 모델 ID와 시험 날짜를 함께 적어야 나중에 결과를 다시 이해할 수 있습니다.
자료 확인
n8n · Prompt Testing Frameworks for Production AI Workflows · 2026-09-21
확인일: 2026년 9월 23일. 표·요청문·흐름도는 이해를 돕기 위해 구성했습니다. 계산 예시는 조건을 별도로 표시했으며, 실제 모델 성능을 측정한 결과는 아닙니다.