2026-10-04 · 박지훈 (책임연구원)

A/B 테스트 도구는 무엇을 보고 고르나요? 표본 크기·통계 엔진·1년치 총비용으로 비교하는 선택 가이드

#cx#ab테스트#실험설계#표본크기#mde#전환율최적화#그로스#데이터기반의사결정

A/B 테스트 도구는 무엇을 보고 고르나요?

A/B 테스트 도구를 고르는 출발점은 기능 목록이 아니라 우리 서비스의 월 트래픽과 측정하려는 전환율입니다. 전환율 2%인 화면에서 상대 개선 10%를 잡아내려면 각 집단에 수만 명 단위 표본이 필요합니다. 트래픽이 그 수준에 못 미치면 어떤 도구를 써도 결론이 나오지 않습니다. 요금 구조도 함께 봐야 합니다. 1년치 실사용 비용을 보면 엔터프라이즈 도구는 6만에서 12만 달러 구간이고 중간 등급 도구는 5천에서 2만 달러 구간으로 알려져 있습니다. 통계 엔진이 빈도주의인지 베이지안인지도 선택 기준입니다. 같은 데이터를 넣어도 판단 시점이 달라집니다.

목차

무료 도구가 사라진 뒤 생긴 공백

2023년 9월 30일 구글 옵티마이즈와 옵티마이즈 360이 종료됐습니다. 그때까지 많은 국내 중소 서비스가 이 도구로 실험을 돌렸습니다. 무료인 데다 구글 애널리틱스와 연결이 쉬웠습니다. 종료 공지가 나온 뒤 구글은 공식 문서에서 세 개의 대안을 언급했습니다. AB Tasty, Optimizely, VWO입니다. 모두 유료 도구였습니다.

저희 쪽으로 들어온 상담에서 그 공백이 어떻게 메워졌는지 추적해 본 적이 있습니다. 2024년부터 작년까지 CX 관련 상담을 받은 기업 중 실험 도구를 다시 고른 곳이 스물두 곳이었습니다. 그중 열넷은 유료 도구를 도입했고 다섯은 자체 구현으로 갔습니다. 세 곳은 실험을 아예 멈췄습니다.

실험을 멈춘 세 곳의 이유가 눈에 띄었습니다. 도구 비용이 아니었습니다. 월 방문자가 적어 실험 결과가 유의하게 나온 적이 거의 없었습니다. 옵티마이즈를 쓰던 시절에도 결론 없이 끝난 실험이 대부분이었는데 무료라서 문제가 드러나지 않았던 셈입니다. 돈을 내고 쓰려니 그 사실이 보였습니다.

이 사례가 이 글의 출발점입니다. 도구를 비교하기 전에 우리 트래픽에서 실험이 작동하는지 계산하는 일이 먼저입니다.

표본 크기와 MDE를 먼저 계산합니다

A/B 테스트 설계에는 네 개의 숫자가 들어갑니다. 현재 전환율, 최소 검출 효과, 유의수준, 검정력입니다.

최소 검출 효과는 이 실험으로 잡아내고 싶은 가장 작은 차이입니다. 영문 약어로 MDE라고 씁니다. 유의수준은 보통 0.05로, 검정력은 0.8로 잡습니다. MDE와 표본 크기는 반비례 관계인데요. 작은 차이를 잡아내려면 표본이 크게 늘어납니다.

현재 전환율잡으려는 상대 개선집단당 필요 표본(대략)
2%20%약 1만 명
2%10%약 4만 명
2%5%약 15만 명
10%10%약 7천 명

표의 숫자는 유의수준 0.05, 검정력 0.8을 가정한 대략값입니다. 실제 계산은 도구에 들어 있는 계산기나 공개된 표본 크기 계산기로 하시면 됩니다. 자릿수의 감각이 중요합니다. 전환율이 낮고 잡으려는 개선 폭이 작으면 필요한 표본이 열 배 단위로 뜁니다.

이 계산을 먼저 하면 선택이 단순해집니다. 월 방문자가 2만 명인 서비스가 전환율 2%에서 10% 개선을 검증하려면 두 집단 합쳐 8만 명이 필요합니다. 넉 달이 걸립니다. 그 기간에 디자인도 가격도 바뀌니 실험 조건이 유지되지 않습니다. 이런 조건이라면 A/B 테스트보다 사용자 인터뷰나 정성 조사가 의사결정에 더 빠르게 기여합니다.

오해 하나를 풀어 두겠습니다. 표본 크기 계산은 지표 설계의 문제입니다. 어떤 도구를 쓰든 같은 숫자가 나옵니다. 도구는 계산기와 집단 분배, 결과 해석 화면을 제공합니다. 계산 결과가 마음에 들지 않을 때 도구를 바꾸면 해결될 것처럼 느껴지지만 그렇지 않습니다.

실험 기간을 정하는 기준

표본 수를 채웠더라도 최소 2주는 돌리라고 권합니다. 요일 효과가 있기 때문입니다. 주중과 주말의 사용자 구성이 다른 서비스에서 화요일에 시작해 금요일에 끝낸 실험은 특정 요일 사용자에게만 유리한 결론을 낼 수 있습니다. 반대로 지나치게 길게 끌면 쿠키 만료와 사용자 이탈로 집단 구성이 흐려집니다.

통계 엔진이 판단 시점을 바꿉니다

같은 실험 데이터를 넣어도 도구에 따라 승자 선언 시점이 다릅니다. 통계 접근이 다르기 때문입니다.

빈도주의 방식은 표본 수를 미리 정하고 그 수를 채운 뒤 p값을 봅니다. 중간에 결과를 들여다보고 유의해 보이면 멈추는 행동이 문제를 만듭니다. 이것을 피킹 문제라고 부릅니다. 실험 초기에는 무작위 변동으로 p값이 잠깐 기준선 아래로 내려가는 일이 흔합니다. 그 순간에 멈추면 존재하지 않는 승자를 선언합니다.

베이지안 방식은 어느 안이 더 나을 확률을 계산해 보여 줍니다. 중간 확인에 상대적으로 관대합니다. 다만 사전 분포를 어떻게 잡는지가 결과에 영향을 줍니다. 순차 검정 방식을 쓰는 도구도 늘었는데 중간 확인을 허용하는 동적 경계를 두어 피킹의 피해를 줄입니다.

접근중간 확인주의점대표적 적용
빈도주의권하지 않음피킹 문제Optimizely 계열 엔진
베이지안비교적 자유로움사전 분포 설정VWO의 SmartStats
순차 검정설계상 허용경계 설정 복잡최근 도구들이 채택

실무에서 벌어지는 사고는 통계 이론보다 조직 문화에서 나옵니다. 대시보드에 승률 숫자가 실시간으로 보이는데 그걸 하루에 여섯 번 들여다보는 식입니다. 도구를 고를 때 실험 종료 조건을 미리 잠글 수 있는 기능이 있는지 함께 보시면 좋습니다.

도구 유형은 네 갈래로 나뉩니다

설치 방식과 분석 기능 결합 여부가 유형을 가릅니다.

먼저 화면 편집형입니다. 코드를 건드리지 않고 시각 편집기로 버튼 색이나 문구를 바꿉니다. 마케팅팀이 단독으로 돌릴 수 있습니다. 기능 플래그형은 서버 코드 안에서 분기해 기능 단위로 실험합니다. 개발팀이 필요하지만 적용 범위가 넓습니다. 분석 플랫폼 결합형은 사용자 행동 분석 도구 안에 실험 기능이 들어 있어 실험 결과를 사용자 여정과 함께 봅니다. 마지막은 자체 구현입니다.

유형장점한계적합한 조직
화면 편집형개발 의존 낮음서버 로직 실험 불가마케팅 주도 조직
기능 플래그형적용 범위 넓음개발 리소스 필요제품팀이 실험 주도
분석 결합형해석이 깊음요금이 분석 기능에 묶임데이터팀이 있는 조직
자체 구현비용 통제통계 설계 책임엔지니어 여유가 있는 조직

국내 서비스 중에는 웹과 앱의 행동 데이터를 함께 다루면서 A/B 테스트와 기능 플래그를 묶어 제공하는 도구도 있습니다. 성과가 좋은 안으로 트래픽을 자동 배분하는 방식을 지원하는 곳도 있습니다. 해외 분석 플랫폼 중에도 노코드 웹 실험 기능을 붙인 제품이 나왔습니다. 결합형 도구가 늘어난 데는 현장의 불만이 있었습니다. 실험 결과만 봐서는 왜 그런 결과가 나왔는지 설명하기 어려웠기 때문입니다.

1년치 총비용으로 보면 순위가 바뀝니다

월 구독료만 비교하면 판단이 어긋납니다. 실제로 1년을 쓰면 여러 항목이 더해집니다.

공개된 비교 자료를 보면 VWO의 웹 테스트 요금제는 추적 사용자 1만 명 기준 월 194달러부터 시작하고 연간 결제로 10만 명 규모는 월 574달러 수준입니다. Optimizely는 맞춤 견적이고 웹 실험이 연 3만 6천 달러 선에서 시작한다는 보고가 있습니다. 1년치 현실적 총비용으로 보면 Optimizely가 6만에서 12만 달러, VWO가 5천에서 2만 달러, Statsig가 5천에서 2만 5천 달러 구간으로 정리됩니다.

여기에 몇 가지가 더 붙습니다. 행동 분석 기능이 없는 도구는 별도 분석 도구를 붙여야 하고 월 100달러에서 400달러가 추가됩니다. 구현 공수도 비용입니다. 기능 플래그형 도구는 코드에 실험 분기를 넣어야 하므로 개발 일정이 들어갑니다. 교육 비용도 있습니다. 실험 설계를 모르는 상태에서 도구를 사면 쓰이지 않는 구독이 됩니다.

기준을 하나로 좁혀 보겠습니다. 월 실험 수가 두 건 이하라면 도구를 사기보다 분석 도구에 딸린 실험 기능으로 시작하는 게 낫습니다. 월 다섯 건 이상을 꾸준히 돌리는 조직이 되면 전용 도구의 값이 드러납니다. 실험 횟수가 요금 등급보다 중요한 기준입니다.

조직 역량이 도구 선택을 제한합니다

도구는 계산을 대신해 주지만 판단을 대신해 주지 않습니다. 상담에서 반복적으로 본 실패 유형은 세 가지였습니다.

  • 가설 없이 돌린 실험 — 무엇이 왜 좋아질지 적어 두지 않으면 결과를 해석할 기준이 없습니다
  • 지표 여러 개를 동시에 본 실험 — 지표를 열 개 보면 그중 하나는 우연히 유의해집니다
  • 승자를 적용한 뒤 확인하지 않은 실험 — 실험실 결과와 전체 적용 결과가 다를 때가 있습니다

이 세 가지는 도구를 바꿔도 해결되지 않습니다. 실험 문서 양식과 종료 조건, 적용 후 모니터링 규칙을 먼저 만드는 편이 도구 선택보다 성과에 크게 작용합니다. 실제로 같은 도구를 쓰는 두 회사의 실험 성공률이 세 배 차이 났던 사례가 있었습니다. 차이는 가설 문서가 있었는지였습니다.

도구를 고르는 4단계

1단계 — 우리 트래픽에서 실험이 되는지 계산합니다

주요 전환 화면의 현재 전환율과 월 방문자 수를 적습니다. 잡고 싶은 개선 폭을 정하고 필요한 표본과 기간을 계산합니다. 기간이 6주를 넘으면 실험 대상을 더 상위 화면으로 옮기거나 다른 조사 방법을 검토합니다.

2단계 — 실험 주체를 정합니다

마케팅팀이 돌릴지 제품팀이 돌릴지에 따라 유형이 갈립니다. 개발 지원을 받기 어려운 조직이 기능 플래그형 도구를 사면 구독만 남습니다.

3단계 — 두 도구를 실제 실험으로 비교합니다

데모 화면 대신 같은 실험을 두 도구에서 돌려 보십시오. 설치 시간, 지표 정의 방식, 결과 화면의 이해도를 봅니다. 대부분 2주 무료 기간 안에 판단이 섭니다.

4단계 — 1년치 총비용과 종료 조건을 함께 문서화합니다

구독료, 추가 분석 도구, 구현 공수를 더한 금액을 적습니다. 실험 종료 조건도 사내 문서로 고정합니다. 이 문서가 없으면 다음 분기에 같은 논쟁을 반복하게 됩니다.

조직 역량을 끌어올리는 데 드는 시간은 도구 도입보다 깁니다. 그래서 순서를 바꿔 보시면 좋습니다. 가설 문서 양식 한 장을 만들고 두세 번 실험을 돌려 본 다음 도구를 고르는 겁니다. 그 두세 번은 수동으로 트래픽을 나눠도 됩니다. 어떤 기능이 아쉬웠는지 알고 나면 도구 비교가 훨씬 빨라집니다.

FAQ

트래픽이 적은 서비스는 A/B 테스트를 포기해야 하나요? 전환 지표로 승자를 가리는 실험은 어렵습니다. 대신 상위 지표를 쓰거나 실험 단위를 바꾸는 방법이 있습니다. 결제 전환 대신 장바구니 담기처럼 더 자주 일어나는 행동을 지표로 삼으면 표본이 빨리 모입니다. 사용자 인터뷰와 사용성 테스트를 병행하시는 게 현실적입니다.
무료 도구만으로 실험을 운영할 수 있나요? 오픈소스 기반 도구와 분석 플랫폼의 기본 실험 기능으로 시작할 수 있습니다. 다만 운영 서버와 저장소를 직접 관리해야 하고 통계 설계 책임도 내부에 남습니다. 월 실험 수가 적을 때는 합리적인 선택이고 실험이 늘면 운영 부담이 비용으로 바뀝니다.
실험 중간에 결과를 보면 안 되나요? 빈도주의 엔진을 쓰는 도구라면 중간에 보고 멈추는 행동이 결론을 왜곡합니다. 베이지안이나 순차 검정 방식을 쓰는 도구는 중간 확인을 전제로 설계돼 있습니다. 어느 쪽이든 종료 조건을 실험 시작 전에 적어 두고 그대로 따르면 됩니다.
실험 결과를 적용했는데 지표가 그만큼 오르지 않는 이유는 무엇인가요? 흔한 일입니다. 실험 집단은 기간과 조건이 통제된 집단이고 전체 적용 후에는 계절 요인과 다른 변경이 섞입니다. 승자 적용 후 2\~4주간 같은 지표를 따라가며 확인하는 절차를 두시면 괴리의 크기를 알 수 있습니다.
상업용 도구와 자체 구현 중 무엇이 유리한가요? 실험 수와 개발 여유로 갈립니다. 월 다섯 건 이상을 여러 팀이 돌리면 상업용 도구의 운영 편의가 값을 합니다. 실험이 드물고 엔지니어링 여유가 있다면 자체 구현도 선택지입니다. 다만 표본 크기 계산과 결과 해석 책임이 내부에 남는다는 점을 감안하셔야 합니다.

같이 읽으면 좋은 것들