본문으로 바로가기
SDA Magazine

논문

스포츠건강 · Machine Learning
Senior Session 05

경기력 데이터로 도핑 의심을 찾을 수 있을까

여자 역도 선수의 경기 기록과 인구통계 정보를 결합한 Athlete's Performance Passport가 도핑 검사 대상을 선별하는 데 어떤 역할을 할 수 있는지 검토했다.

SDA 시니어 세션9분 읽기
도핑 의심 예측 모델 성능과 변수 중요도 분석 결과
도핑 의심 예측 모델 성능과 변수 중요도 분석 결과

연구가 제안한 APP

기존 Athlete Biological Passport가 생체 지표를 중심으로 본다면, 이 연구의 Athlete's Performance Passport는 연령, 체급, 체중, 인상·용상 기록과 제재 이력을 함께 사용한다. 목표는 도핑을 확정하는 것이 아니라 추가 검사가 필요한 이상 패턴을 선별하는 것이다.

모델과 데이터

1998년부터 2020년까지 공개된 여자 역도 경기력 데이터를 바탕으로 Logistic Regression, XGBoost, MLP와 ensemble을 비교했다. 복잡한 비선형 관계를 읽는 tree model과 neural network의 장점을 결합한 ensemble이 가장 좋은 F1 score를 기록했다.

세션에서 본 의미

  • 검사 자원이 한정된 상황에서 위험 신호를 더 체계적으로 찾을 수 있다.
  • 경기력 향상은 훈련으로도 발생하므로 예측 결과를 도핑 판정처럼 사용해서는 안 된다.
  • 제재 데이터 자체의 편향과 적은 양성 표본이 모델의 판단에 그대로 반영될 수 있다.

필요한 안전장치

모델은 검사 우선순위를 정하는 보조 수단이어야 한다. 개인에게 불이익을 주는 자동 판정으로 확장하기 전에 설명 가능성, 오탐 비용, 종목별 외부 검증과 개인정보 보호 기준이 함께 마련돼야 한다.

위험 점수는 판정문이 아니다. 검사를 어디에 더 배분할지 돕는 신호로만 사용해야 한다.

논문 정보와 모델 결과

Frontiers in Physiology 2024 연구는 1998~2020년 여자 역도 기록 17,058개를 사용했다. 연령, 체중, 체급, 경기력과 제재 이력으로 Logistic Regression, XGBoost, MLP와 앙상블을 비교했다.

테스트 성능AccuracyAUC-ROCF1
MLP0.8750.7600.621
XGBoost + MLP0.8750.7830.645

앙상블은 2008·2012·2016 올림픽에서 이후 제재된 선수 39명 중 21명을 의심 사례로 분류했다. 전체 탐지율은 53.8%였지만 제재되지 않은 선수도 일부 의심으로 분류했다. 따라서 이 결과는 도핑 판정 정확도가 아니라 검사 대상 선별 능력으로 읽어야 한다.

특성 중요도에서는 체중, 인상 기록, 체급이 먼저 나타났다. 연령은 깊은 트리에서야 작은 기여를 보여 특정 나이 자체를 위험 신호로 해석해서는 안 된다.

세션에서 남긴 질문

  1. 과거 제재 이력의 편향이 미래 선수의 위험 점수에 반복되지 않게 하려면 무엇이 필요한가?
  2. 선수에게 모델 판단의 근거와 이의 제기 절차를 어떻게 제공할 것인가?
  3. 종목과 체급이 달라져도 성능과 공정성이 유지되는가?

SESSION MATERIALS

논문과 발표자료

2 FILES & LINKS

SDA Magazine 소개

SDA Magazine은 스포츠의 결과를 넘어 선택과 맥락을 데이터로 읽는 고려대학교 SDA의 분석 저널입니다.

이어서 읽기

전체 기사 →