같은 질문인데 왜 AI 답변이 매번 다를까
같은 질문을 반복해도 AI 답변이 매번 달라지는 이유와, 의미 있게 측정하는 네 가지 방법을 정리합니다.

같은 질문을 다시 물었는데 다른 답이 나왔다면 측정이 잘못된 것이 아니라 원래 그런 것입니다. 한 번 물어본 결과만으로 나온다, 안 나온다를 가르지 말고 같은 질문을 여러 번 반복해 비율로 봐야 합니다. 이 글은 답이 매번 달라지는 이유와, 그 변동 속에서도 의미 있게 측정하는 방법을 정리합니다.
답이 매번 달라지는 이유
생성형 AI는 답을 만들 때마다 다음에 올 단어를 확률에 따라 고릅니다. 이 확률적 선택 방식을 조절하는 값을 흔히 온도(temperature)라고 부르는데, 이 값이 0보다 크면 같은 질문에도 단어 선택과 문장 전체가 회차마다 달라질 수 있습니다. 상용 대화형 AI 서비스는 대체로 이 값을 0보다 크게 둔 채로 운영되므로, 같은 질문을 두 번 물어도 완전히 같은 문장이 나오는 경우는 드뭅니다.
이 확률적 선택은 어떤 브랜드가 답변에 먼저 언급되는지, 몇 곳이 함께 언급되는지에도 그대로 영향을 미칩니다. 첫 문장에서 다른 단어가 선택되면 그 뒤로 이어지는 문장 전체가 달라지고, 그 과정에서 특정 브랜드가 언급되거나 빠질 수 있습니다.
여기에 로그인 여부나 접속 위치, 질문을 던진 시점에 따라 참고하는 검색 결과 자체가 달라지는 점까지 맞물립니다. 로그인한 계정의 과거 대화 이력이나 위치 정보가 검색 결과에 반영되면, 같은 질문이라도 사람마다 다른 답을 받게 됩니다.
같은 서비스 안에서의 변동과 별개로, 챗GPT와 제미나이, 퍼플렉시티처럼 서로 다른 서비스 사이의 차이도 있습니다. 각자 다른 모델과 다른 검색 결과를 바탕으로 답을 만들기 때문에, 한 서비스에서 나온 비율을 다른 서비스에도 그대로 적용할 수 없습니다. 그래서 측정표에는 어떤 엔진에서 잰 값인지를 반드시 따로 적어야 합니다.
한 번 물어본 결과로 결론 내리면 안 되는 이유
그래서 "오늘 물어보니 우리 회사가 나왔다"거나 "안 나왔다"는 한 번의 결과는 그 자체로 증거가 되기 어렵습니다. 같은 질문을 5번, 10번 반복했을 때 나오는 비율을 봐야 비로소 어느 정도 패턴이 보입니다.
다섯 번 중 한 번 나온 것과 다섯 번 중 네 번 나온 것은 같은 "나왔다"지만 뜻이 전혀 다릅니다. 앞은 20%, 뒤는 80%이고, 이 차이는 한 번의 답변 화면만으로는 구분할 수 없습니다.
우연히 한 번 나온 결과를 전체 경향으로 오해하면, 실제로는 거의 안 나오는데 나온다고 믿거나 반대로 실제보다 비관적으로 판단하게 될 수 있습니다. 측정 횟수를 늘리는 것은 그래서 정확도의 문제가 아니라 애초에 결론을 낼 수 있는 자격을 갖추는 일에 가깝습니다.
의미 있게 측정하려면
첫째, 같은 질문을 최소 5회 이상 반복해서 비율로 봅니다. 한 번 나왔다고 끝내지 않고, 다섯 번 가운데 몇 번인지를 기록합니다.
둘째, 로그인하지 않은 상태에서 매번 새 세션을 열어 묻습니다. 시크릿 창이나 임시 채팅을 쓰면 됩니다. 로그인 상태나 이전 대화 기록이 남아 있으면 그 계정에 맞춰 답이 편향될 수 있기 때문입니다.
셋째, 질문 문장을 그대로 유지합니다. AI는 문장을 작은 단위로 쪼개 처리하기 때문에 조사나 어순만 바뀌어도 전혀 다른 입력으로 받아들여 결과가 달라질 수 있습니다. 첫 회차에 쓴 문장을 그대로 복사해 다음 회차에 붙여 넣는 편이 안전합니다.
넷째, 측정한 날짜와 시간, 실제로 입력한 문장을 그대로 기록해 둡니다. 그래야 나중에 같은 질문으로 다시 측정했을 때 비교할 수 있습니다.
측정 기록표에 넣을 항목
다섯 번을 물었다면 그 결과를 표로 남겨 둡니다. 회차마다 한 줄씩, 아래 항목을 채우면 됩니다.
| 항목 | 적는 내용 |
|---|---|
| 측정일 | 날짜와 시간대 |
| 엔진 | 서비스 이름 |
| 질문 문장 | 입력한 그대로 복사해 붙여넣기 |
| 순서 | 다섯 번 중 몇 번째인지 |
| 등장 여부 | 회사 이름이 나왔는지, 몇 번째 문장에서 나왔는지 |
| 동반 언급 | 답변에 같이 실린 다른 이름 |
표로 남겨 두면 "다섯 번 중 몇 번"이라는 비율이 숫자로 남아서, 다음 달 같은 조건으로 다시 재었을 때 두 시점을 나란히 비교할 수 있습니다. 화면 캡처도 함께 보관해 두면 나중에 어떤 문장이 나왔는지까지 되짚어 볼 수 있습니다.
비율만 보고 끝내지 않고 동반 언급 칸도 함께 살펴봅니다. 다섯 번 내내 같은 곳들이 함께 나온다면, 그 답변 안에서 우리 회사와 나란히 비교되는 대상이 누구인지가 표에 그대로 드러납니다. 등장 여부와 동반 언급은 따로 움직이는 값이어서, 둘을 같이 봐야 전체 그림이 보입니다.
흔히 하는 실수
한 번의 답변 화면으로 나온다, 안 나온다를 결론 내리는 것이 가장 흔한 실수입니다. 화면 한 장은 다섯 번 중 한 번일 뿐이고, 그 한 번이 전체를 대표한다는 보장은 없습니다.
회차마다 질문 문장을 조금씩 바꾸는 것도 피해야 합니다. 더 자연스러워 보이려고 표현을 매번 다듬으면 사실상 다른 질문을 묻는 셈이 되어, 회차 사이의 차이가 질문 때문인지 AI의 변동 때문인지 구분할 수 없게 됩니다.
평소 업무용 계정으로 로그인한 채 반복해서 묻는 것도 문제입니다. 그 계정에 쌓인 대화 이력과 위치 정보가 답변에 섞여 들어가, 다른 사람이 같은 질문을 던졌을 때와는 다른 결과를 보게 됩니다.
AI에게 업체 순위를 매겨 달라고 요청한 뒤 그 점수를 측정값으로 쓰는 것도 피해야 합니다. 이런 질문은 실제 이용자가 던지는 질문과 형태가 다르고, AI가 그 자리에서 즉석으로 만들어 낸 순위이지 반복 측정으로 얻은 비율이 아닙니다.
변화를 추적하려면
한 번 측정으로 끝내지 않고 같은 방식으로 주기적으로 다시 재면 비율이 올라가는지 내려가는지가 보입니다. 이것이 "어제는 나왔는데 오늘은 안 나왔다"는 하루짜리 걱정보다 더 의미 있는 신호입니다.
측정 주기는 1주에서 2주 사이가 적당합니다. 너무 자주 재면 회차 사이의 자연스러운 변동과 실제 추세 변화를 구분하기 어렵습니다. 반대로 너무 뜸하게 재면 그사이 무엇이 바뀌어 비율이 달라졌는지 짚어내기 어렵습니다.
측정을 거듭할수록 표에 쌓인 기록 자체가 자산이 됩니다. 한 번의 측정값보다 몇 달치 추이가 훨씬 설득력 있는 근거가 되기 때문입니다.
구체적인 기록 방법은 질문을 엔진마다 다섯 번씩 물어 표로 남기는 절차를 다룬 글에 정리해 두었습니다. 자세히 보기