← 블로그로 돌아가기

작은 모델이 비싼 모델을 이기는 조건은 검색 루프다

더 큰 모델을 호출하는 것이 항상 더 좋은 검색 결과를 보장하지는 않는다. 검색할 질문을 쪼개고, 여러 번 확인하고, 틀린 경로를 버리는 루프를 설계하면 작은 모델도 훨씬 비싼 모델과 경쟁할 수 있다. 중요한 것은 모델의 크기보다 한 번의 호출을 어떻게 작업 흐름으로 바꾸느냐이다.

TL;DR

  • 검색 품질은 모델 크기 하나가 아니라 검색 계획, 반복 횟수, 검증 방식의 조합으로 결정된다.
  • 작은 모델을 쓰려면 단순히 모델을 교체할 것이 아니라 여러 번 탐색하고 결과를 비교하는 루프를 붙여야 한다.
  • 비용을 줄이는 가장 현실적인 방법은 모든 단계에 강한 모델을 쓰는 것이 아니라, 쉬운 단계와 어려운 단계를 분리하는 것이다.
  • 좋은 검색 제품은 답변만 보여주지 않고 어떤 검색 경로와 종료 조건을 사용했는지도 설명한다.

왜 지금 중요한가

AI 검색을 붙일 때 가장 쉬운 결정은 더 강한 모델을 고르는 것이다. 품질이 부족하면 상위 모델을 호출하고, 비용이 높으면 호출 횟수를 줄인다. 이 방식은 빠르지만 제품이 성장할수록 한계가 분명해진다. 검색 한 번의 가격과 지연 시간이 모든 사용자와 모든 질문에 똑같이 붙기 때문이다.

최근 공개된 사례는 다른 방향을 보여준다. GeekNews에 소개된 Castform 사례에서는 강화학습 후처리를 거친 4B 오픈 모델이 검색 정확도에서 GPT-5.6 Sol과 비슷한 수준을 보이면서 비용은 100분의 1이었다고 보고했다. 이 결과를 모든 검색 문제에 일반화할 수는 없지만, 한 가지 질문은 남는다.

비싼 모델을 부르는 대신, 작은 모델이 더 잘 일하도록 검색 과정을 설계할 수 있지 않은가?

핵심 흐름

검색은 한 번의 답변이 아니라 탐색 과정이다

짧고 명확한 질문은 한 번의 검색으로 충분할 수 있다. 하지만 여러 조건을 비교하거나 최신 정보를 확인해야 하는 질문은 다르다. 첫 번째 결과에서 멈추면 검색어가 잘못되었는지, 중요한 출처를 놓쳤는지 알기 어렵다.

검색 에이전트의 작업을 단순화하면 다음과 같다.

  1. 질문을 검색 가능한 하위 질문으로 나눈다.
  2. 첫 번째 검색 결과에서 부족한 정보와 충돌하는 정보를 찾는다.
  3. 부족한 부분을 채우는 후속 검색을 실행한다.
  4. 출처와 결과를 비교하고 답변을 만들 조건을 확인한다.
  5. 더 찾을 가치가 있는지 판단하고 종료한다.

이 구조에서는 모델이 매번 완벽한 답을 내는 것보다, 다음 검색을 제대로 고르는 능력이 중요하다.

작은 모델은 루프의 각 단계에 배치된다

작은 모델을 단독으로 모든 결정을 맡기는 방식은 위험하다. 대신 작업을 나눈다.

  • 검색어 생성: 빠르고 저렴한 모델
  • 결과 요약과 중복 제거: 작은 모델 또는 규칙 기반 처리
  • 충돌 감지: 별도 분류기나 검증 단계
  • 최종 합성: 질문의 난도에 따라 더 강한 모델

이렇게 하면 어려운 질문에만 비싼 추론을 사용한다. 모든 요청을 같은 가격의 파이프라인에 넣지 않고, 작업의 불확실성과 영향도에 따라 경로를 바꾸는 것이다.

루프에는 반드시 종료 조건이 있어야 한다

검색을 반복한다고 품질이 무한히 좋아지지는 않는다. 검색 결과가 더 이상 새로운 근거를 추가하지 않거나, 핵심 출처가 서로 일치하거나, 예산과 시간 한도에 도달하면 멈춰야 한다.

종료 조건이 없으면 작은 모델의 비용 이점도 사라진다. 모델 호출을 줄이는 것만큼, 불필요한 반복을 멈추는 것이 중요하다.

실제 사례 / 신호

이번 자료에서 가장 눈에 띄는 신호는 모델 크기와 검색 품질을 분리해서 볼 수 있다는 점이다.

  • GeekNews에 소개된 Castform 사례는 4B 오픈 모델과 강화학습 후처리, 다중 턴 검색을 결합한 접근을 다룬다.
  • 자료는 GPT-5.6 Sol 기반 검색과 비교해 비슷한 검색 정확도와 100분의 1 비용을 주장한다.
  • 비교 결과는 특정 벤치마크와 구현에 기반하므로 모든 도메인의 검색 품질을 보장하지는 않는다.
  • 그럼에도 검색 계획, 반복 탐색, 모델 선택을 하나의 시스템으로 봐야 한다는 제품 설계 신호는 분명하다.

여기서 중요한 것은 “4B 모델이 최고 모델을 이겼다”는 자극적인 결론이 아니다. 더 재현 가능한 결론은 이것이다. 모델 호출은 검색 시스템의 한 부품이며, 검색 시스템 전체의 설계가 결과와 비용을 함께 결정한다.

실전 활용 팁: 모델보다 먼저 검색 경로를 설계하는 법

1. 질문을 난이도가 아니라 불확실성으로 분류한다

질문이 길다고 어려운 것은 아니다. 짧아도 최신 가격, 법률, 보안처럼 틀렸을 때 비용이 큰 질문은 여러 출처를 확인해야 한다. 입력 단계에서 최신성, 충돌 가능성, 실패 비용을 표시한다.

2. 첫 검색을 최종 답변으로 취급하지 않는다

첫 결과에는 검색어의 편향이 들어 있다. 첫 결과에서 바로 답을 만들지 말고, “무엇이 아직 확인되지 않았는가?”를 한 번 묻는다. 이 질문 하나가 후속 검색의 품질을 크게 바꾼다.

3. 쉬운 단계는 작게, 중요한 단계는 깊게 만든다

중복 제거와 형식 변환에 강한 모델을 쓸 필요는 없다. 반대로 여러 출처가 충돌하거나 의사결정 영향이 큰 부분은 더 강한 모델이나 사람 검토로 올린다. 모델 라우팅은 모델 목록이 아니라 작업 계약의 문제다.

4. 답변과 함께 근거 상태를 남긴다

검색 결과에는 출처 수, 마지막 확인 시점, 충돌 여부, 추가 검색 여부를 함께 표시한다. 사용자가 답변의 문장만 믿는 대신 어떤 조건에서 결과가 나왔는지 판단할 수 있어야 한다.

바로 해볼 실험

검색 기능이 있는 작은 AI 도구 하나를 골라 다음 세 경로를 비교한다.

  1. 강한 모델을 한 번 호출한다.
  2. 작은 모델로 검색어를 두 번 확장하고 결과를 비교한다.
  3. 작은 모델로 탐색한 뒤 충돌이 있을 때만 강한 모델을 호출한다.

각 경로에서 비용, 응답 시간, 출처 수, 사람이 발견한 오류를 기록한다. 정확도 하나만 비교하지 말고 사용자가 결과를 검증하는 데 걸리는 시간까지 측정한다.

첫 실험의 목표는 가장 좋은 모델을 찾는 것이 아니다. 어떤 질문에서 추가 검색이 실제 품질을 올리고, 어떤 질문에서는 단지 지연만 늘리는지 확인하는 것이다.

리스크 / 반론

작은 모델과 검색 루프가 항상 더 좋은 것은 아니다. 검색 대상이 빈약하거나 후속 검색을 고르는 정책이 약하면 반복할수록 잡음이 늘어난다. 검색 결과가 서로 비슷해도 모두 같은 잘못된 출처를 복제할 수 있다.

“100배 저렴하다”는 비교도 모델 가격만으로 판단하면 안 된다. 인프라, 캐시, 검색 API, 저장 비용, 지연 시간, 운영 복잡도를 함께 계산해야 한다. 또한 특정 벤치마크의 검색 정확도가 실제 사용자의 모든 질문을 대표하지 않는다.

따라서 작은 모델을 도입할 때는 비용 절감 숫자보다 실패 조건을 먼저 정해야 한다. 어떤 질문은 자동으로 종료하고, 어떤 질문은 강한 모델이나 사람에게 넘길지 명시해야 한다.

결론

AI 검색의 경쟁력은 가장 큰 모델을 호출하는 데서만 나오지 않는다. 질문을 분해하고, 부족한 근거를 다시 찾고, 충돌을 확인하고, 충분한 시점에 멈추는 루프가 모델의 능력을 제품 성능으로 바꾼다.

검색 기능을 만들고 있다면 다음 질문부터 던져야 한다.

  • 이 질문은 한 번의 검색으로 끝낼 수 있는가?
  • 다음 검색이 필요한지 판단할 기준은 무엇인가?
  • 어떤 단계까지 작은 모델로 처리할 수 있는가?
  • 결과를 믿을 근거와 종료 조건을 사용자에게 보여주는가?

모델을 바꾸기 전에 검색 경로를 그려보자. 비용을 낮추면서도 품질을 지키는 첫 번째 개선은 더 큰 모델이 아니라 더 명확한 루프일 수 있다.

Sources