AI 시안 네 개를 받았는데 무엇이 더 좋은지 설명하기 어렵다면
웹사이트나 로고를 여러 AI 모델에 맡기면 결과는 금방 쌓입니다. 문제는 그다음이에요. 한 시안은 깔끔하지만 브랜드와 어울리지 않고, 다른 시안은 눈에 띄지만 정보 위계가 흐립니다. 결국 모델 이름이나 첫인상에 기대어 하나를 고르기 쉽습니다.
DesignArena가 파고든 지점이 바로 이 모호한 선택입니다. 같은 프롬프트로 만든 결과의 모델명을 숨기고, 두 개씩 반복해서 고르게 한 뒤 그 선택을 순위 데이터로 바꿉니다. ‘취향’을 설명하라고 요구하는 대신 둘 중 어느 쪽을 택했는지를 수집하는 구조예요.
이 방식은 모델 후보를 좁히는 데 유용하지만, 1위가 곧 접근성이나 전환율까지 가장 뛰어나다는 뜻은 아닙니다. DesignArena의 순위가 측정하는 것은 참여자들이 비교 상황에서 보인 선호이기 때문입니다.
한 번의 평가에는 선택이 다섯 번 들어갑니다
공식 방법론을 보면 단순한 인기 투표보다 구조가 촘촘합니다. 한 세션에서 서로 다른 네 모델이 같은 프롬프트를 받고, 사용자는 모델명을 모르는 상태에서 결과 두 개를 비교합니다. 첫 두 번의 선택으로 승자와 패자를 나누고, 이어지는 대진과 타이브레이커까지 총 다섯 번 선택해 1위부터 4위까지 정합니다.
여기서 가져갈 설계 원칙은 ‘익명·동일 입력·반복 선택’입니다. 모델명을 가려 브랜드 선입견을 줄이고, 입력을 같게 유지해 비교 대상을 맞추며, 한 번의 선택 대신 여러 쌍을 비교해 전체 순서를 만듭니다.
누적 리더보드는 모든 쌍대 비교에 같은 가중치를 주고 Bradley–Terry 모델로 평점을 계산합니다. 주요 차트에서는 비교가 50회 미만인 모델을 제외하며, 일반적으로 200회에 도달하기 전 결과에는 예비 표시를 붙입니다. 다만 이는 순위의 안정성을 위한 운영 기준이지, 디자인의 사용성이나 사업 성과를 검증하는 기준은 아닙니다.
6개월 ARR 12배는 회사가 공개한 성장 수치입니다
운영사 Intelligence의 공동창업자 Grace Li는 연간 반복 매출인 ARR이 6개월 동안 500만 달러에서 6,000만 달러로 늘었고, 서비스가 190여 개국 550만 명에게 도달했다고 발표했습니다. 계산상 12배 성장입니다. 회사는 2026년 8월 Index Ventures가 주도한 790만 달러 시드 투자도 발표했고, TechCrunch 역시 당시 회사 설명을 바탕으로 ARR 6,000만 달러를 보도했습니다.
눈에 띄는 숫자지만 실제 인식 매출이나 수익성과 같게 읽으면 안 됩니다. ARR 산식, 계약 기간, 고객 유지율, 총마진은 공개되지 않았고 이용자 수도 창업자 발표의 550만 명과 TechCrunch 보도의 530만 명 사이에 차이가 있습니다. 확인되는 결론은 회사 측 발표 기준 ARR이 빠르게 증가했다는 데까지입니다.
비슷한 비교 서비스를 운영한 Yupp의 폐업도 DesignArena의 성공 공식을 단순화하지 말아야 할 이유입니다. Yupp는 800개 모델을 비교하고 선호 데이터를 연구소에 판매하려 했으며, 회사 발표 기준 이용자 130만 명과 일부 고객을 확보했습니다. 2024년 3,300만 달러를 조달했지만, 서비스 출시 후 1년이 되기 전에 문을 닫았습니다. 창업진은 제품·시장 적합성이 충분하지 않았고 모델 환경이 빠르게 변했다고 설명했습니다. 공개 자료만으로 ‘범용이라 실패했고 디자인에 집중해서 성공했다’는 단일 원인을 확정할 수는 없습니다.
첫 실험은 리더보드보다 평가 기준에서 시작하세요
DesignArena는 웹사이트, 슬라이드, 모바일 앱, 게임, 이미지, 로고, SVG 등 여러 형식의 결과를 비교할 수 있게 구성돼 있습니다. 지원 형식과 모델은 바뀔 수 있으므로 시작 화면에서 현재 제공되는 항목을 먼저 확인하세요.
아래 실습의 목적은 가장 높은 순위의 모델을 찾는 것이 아니라, 같은 기준으로 익명 결과를 끝까지 비교해보는 것입니다.
- 공유 가능한 입력만 준비합니다. 서비스는 만 18세 이상을 대상으로 합니다. 프롬프트, 업로드 미디어, 생성 결과와 투표는 수집되고 제3자 AI 제공자의 평가·개선·개발 또는 잠재적 학습에 공유될 수 있으므로 고객 자료, 개인정보, 미공개 브랜드 자산은 넣지 마세요.
- 평가 기준을 먼저 세 개로 고정합니다. 예를 들어 B2B 대시보드라면 ‘정보 위계’, ‘오류 예방’, ‘WCAG 대비’처럼 결과를 본 뒤 바꾸지 않을 기준을 적어둡니다.
- DesignArena 시작 화면에서 로그인합니다. 생성 결과를 받으려면 로그인이 필요합니다. 처음 이용한다면 생성 전에 Sign In을 눌러 기존 계정으로 로그인하거나 안내에 따라 계정을 만드세요.
- 형식 하나를 선택하고 같은 요청문으로 생성을 시작합니다. 첫 입력은 이렇게 좁혀볼 수 있어요. “B2B 분석 도구의 데스크톱 온보딩 대시보드를 만들어줘. 왼쪽 탐색, 데이터 연결 진행 상태, 다음 행동 하나를 강조하는 카드가 필요해. 실제 고객명이나 데이터는 사용하지 마.”
- 모델명을 추측하지 말고 정해둔 기준으로 다섯 번 선택합니다. 공식 절차대로라면 네 모델의 익명 결과를 두 개씩 비교한 뒤 1위부터 4위까지의 순서를 얻게 됩니다.
- 결과는 후보를 줄이는 신호로만 기록합니다. 공개 리더보드와 순서가 다르더라도 틀린 결과는 아닙니다. 실제 고객층을 대상으로 접근성 점검, 사용성 과제 또는 전환 실험을 별도로 통과해야 제품 의사결정의 근거가 됩니다.
첫 성공 기준은 예쁜 시안 한 장이 아닙니다. 동일한 입력과 기준을 유지한 채 다섯 번의 선택을 마치고, 왜 1위를 골랐는지 세 기준으로 설명할 수 있으면 충분합니다. 원하는 형식이 중단됐거나 필요한 모델이 없다면 사용 가능한 형식으로 평가 구조만 연습하고, 그 순위를 실제 프로젝트에 옮기지는 마세요.



