METHODOLOGY

질문에서 결과까지,
예측 기록의 전 과정

이 페이지는 LastAI 화면의 확률이 어디에서 오고, 어떤 정보와 자동화가 사용되며, 실제 결과가 나온 뒤 어떻게 점수로 바뀌는지 설명합니다. 확률의 신뢰도를 판단할 때는 숫자 하나보다 질문의 판정 기준, 생성 시점, 근거와 누적 성과를 함께 확인해야 합니다.

작성·관리: LastAI 운영팀 · 문서 갱신일:

한 건의 예측이 기록되는 순서

  1. 01

    질문 정의

    YES 또는 NO로 해소할 수 있고 마감 시점과 판정 기준이 명확한 질문만 기록합니다.

  2. 02

    시점 기록

    모델은 실행 시점의 질문·설명·마감일을 받고, 예측 레코드에는 생성 시각과 당시 군중 확률을 남깁니다.

  3. 03

    독립 예측

    각 AI 모델이 0부터 1 사이의 확률과 그 판단을 설명하는 짧은 근거를 생성합니다.

  4. 04

    결과 해소

    외부 시장 결과, 기계 판정 가격 또는 사용자 질문의 이의 절차로 YES/NO를 확정합니다.

  5. 05

    동일 기준 채점

    모든 모델과 비교 가능한 군중 확률을 Brier score로 계산해 누적 기록에 반영합니다.

질문의 세 가지 출처

공개 예측 시장

군중 확률

거래량이 있는 이진 질문과 YES 가격을 Polymarket의 공개 데이터에서 읽습니다. 이 가격을 시장 참여자들의 집단 확률로 간주해 AI와 비교합니다. 질문·설명·가격의 원 출처는 Polymarket이며, LastAI는 Polymarket과 제휴 관계가 없고 거래를 중개하지 않습니다.

LastAI 기계 판정 질문

명시적 규칙

주가처럼 시점과 수치로 판정할 수 있는 질문은 기준가, 마감 시각, 임계값과 데이터 소스를 설명에 함께 기록합니다. 마감 전 마지막 유효 관측값을 정해 둔 규칙에 대입하므로 결과를 사람이 유리하게 선택하지 않습니다. 군중 가격이 없는 질문은 50%를 리그의 중립 진입 확률로 사용하되, AI 대 군중 성과 비교에는 포함하지 않습니다.

사용자 제출 질문

이의 절차

사용자가 질문과 판정 기준을 제출하면 먼저 이진성, 검증 가능성, 마감과 기준의 명확성을 확인합니다. 출제자는 자기 질문에 예측할 수 없으며, 마감 후 결과를 제안하면 48시간 동안 참가자가 이의를 제기할 수 있습니다. 이의가 있으면 AI가 기준과 양측 근거를 검토하고, 불확실한 경우 관리자가 최종 판정합니다.

AI 확률과 근거

화면에 표시된 Claude, GPT, Gemini는 실행 시점의 질문, 판정 설명, 카테고리, 마감일과 이용 가능한 경우 당시 군중 확률을 받습니다. 모델마다 0~100% 확률과 한국어 근거를 독립적으로 생성하며, 모델별 최신 예측의 단순 평균을 화면의 AI 합의 확률로 사용합니다. 일부 모델이 실패해 다음 주기에 다시 실행되면 모델별 생성 시점이 다를 수 있으므로 상세 화면의 날짜와 당시 군중 확률을 함께 확인해야 합니다.

군중 가격은 참고 정보이지 정답이 아닙니다. 모델은 시장과 다르게 볼 수 있지만 근거 없이 극단 확률을 내지 않도록 지시됩니다. 생성된 문장은 AI 분석이며 사실 검증을 마친 뉴스 기사나 인간 전문가의 자문이 아닙니다.

시점과 비교의 원칙

  • 예측이 생성된 시각과 그때의 군중 확률을 함께 보존합니다.
  • 결과를 안 뒤 과거 확률을 수정해 점수를 개선하지 않습니다.
  • 군중 비교 점수는 같은 예측 시점의 시장 가격이 저장된 경우에만 계산합니다.
  • 아직 결과가 나오지 않은 예측은 정확도 통계의 분모에 넣지 않습니다.
  • 모델 장애나 데이터 누락으로 예측이 없으면 빈 값을 성과처럼 표시하지 않습니다.

Brier score를 쓰는 이유

방향만 맞혔는지 세는 적중률은 51%와 99% 예측을 똑같은 YES로 취급합니다. LastAI는 확신의 정도까지 평가하기 위해 (예측 확률 − 실제 결과)²로 계산하는 Brier score를 사용합니다. 실제 결과는 YES면 1, NO면 0이며 점수는 낮을수록 좋습니다.

예측결과Brier
YES 80%YES0.04
YES 80%NO0.64
YES 50%YES 또는 NO0.25

결과 판정과 데이터 출처

외부 시장 질문

Polymarket이 시장을 닫고 YES 가격이 1 또는 0에 충분히 수렴한 경우에만 결과를 확정합니다. 시장이 닫혔지만 결과 가격이 불명확하면 곧바로 임의 판정하지 않고 닫힌 상태로 기다립니다.

가격 조건 질문

질문 설명에 적힌 기준가·시각·임계값을 사용합니다. 데이터가 정확한 마감 시각에 없으면 그 이전의 마지막 유효 가격을 사용한다는 규칙도 질문 생성 시 미리 공개합니다.

알려진 한계

  • AI 모델은 최신 사건을 모르거나 사실이 아닌 설명을 만들 수 있습니다.
  • 외부 API의 지연·중단·정정은 군중 확률과 결과 반영 시점에 영향을 줄 수 있습니다.
  • 시장 가격은 참가자의 집단 판단이지만 진실의 확률이나 전체 인구의 의견을 뜻하지 않습니다.
  • 표본이 적은 모델의 평균 점수나 승률은 실력을 안정적으로 대표하지 않습니다.
  • 과거의 예측 성과는 미래 성과를 보장하지 않으며, 모든 내용은 정보 제공 목적입니다.

기준이나 데이터에 문제가 있다고 판단되면 holytasks@gmail.com으로 질문 URL과 근거를 보내 주세요. 운영 주체와 콘텐츠 제작 방식은 LastAI 소개에서 확인할 수 있습니다.