본문으로 바로가기
SDA Magazine

논문

스포츠 영상 · Computer Vision
Senior Session 02

골 장면의 정확한 순간을 찾는 법

긴 경기 영상에서 이벤트가 발생한 정확한 프레임을 찾기 위해 장기 시간 의존성과 클래스 불균형을 함께 해결한 CVPR 연구를 검토했다.

SDA 시니어 세션9분 읽기
골 이벤트 전후 프레임과 temporal block 구조를 비교한 발표 슬라이드
골 이벤트 전후 프레임과 temporal block 구조를 비교한 발표 슬라이드

왜 정확한 한 프레임이 어려운가

골, 슛, 카드처럼 스포츠 이벤트는 긴 영상 속 특정 순간에 발생한다. 슛이 유효했는지는 공이 발을 떠난 순간만 보고 알 수 없고 이후 골키퍼의 반응과 공의 궤적까지 봐야 한다. 반대로 퇴장처럼 드문 이벤트는 학습 데이터가 매우 적어 자주 발생하는 장면에 묻히기 쉽다.

연구의 접근

연구는 공간과 시간 특징을 다듬는 ASTRM, 긴 구간의 문맥을 읽는 temporal module, 드문 클래스의 표현을 분리하는 Soft Instance Contrastive loss를 결합했다. 거대한 사전학습 모델의 특징을 고정해 쓰기보다 과제에 맞는 네트워크를 end-to-end로 학습한 점도 핵심이다.

세션에서 확인한 점

  • 가까운 프레임만으로는 알 수 없는 이벤트를 미래 문맥까지 사용해 구분했다.
  • 클래스 불균형이 큰 카드·유효 슛 항목에서 기존 방법보다 뚜렷한 개선을 보였다.
  • 스포츠 하이라이트 자동 생성과 정밀 이벤트 데이터 구축에 직접 연결할 수 있다.

비판과 다음 질문

높은 평균 성능만으로 드문 이벤트의 실무 신뢰성을 보장할 수는 없다. 종목별 규칙과 카메라 구성이 달라졌을 때도 성능이 유지되는지, 오탐을 사람이 얼마나 빠르게 검수할 수 있는지까지 평가해야 한다.

정확한 이벤트 탐지는 하이라이트를 만드는 기술이면서, 사람이 다시 볼 영상의 범위를 줄이는 검색 기술이기도 하다.

논문 정보와 성능

CVPR 2025에 발표된 이 연구는 SoccerNet V2, Tennis, FS-Comp, FS-Perf, FineGym을 사용했다. ASTRM은 공간·시간 특징을 보정하고, long-range temporal module은 이벤트 이후의 문맥을 읽는다. Soft-IC loss는 카드처럼 드문 클래스가 다수 클래스에 묻히지 않도록 표현을 분리한다.

허용 오차가 없는 δ=0 조건에서의 결과는 다음과 같다.

데이터셋제안 모델 mAP
Tennis61.01
FS-Comp37.54
FS-Perf40.36
FineGym15.24

오차 허용 폭을 넓힌 조건에서는 모든 데이터셋에서 항상 최고는 아니었다. 강점은 대략적인 구간보다 정확한 프레임을 찾는 엄격한 조건에서 더 분명했다.

실제 서비스로 옮길 때

  • 희귀 이벤트는 평균 mAP와 별도로 클래스별 재현율을 확인해야 한다.
  • 종목마다 이벤트 정의와 카메라 구성이 달라 재라벨링이 필요하다.
  • 자동 하이라이트는 탐지 시점뿐 아니라 전후 맥락을 포함해야 한다.

세션에서 남긴 질문

  • 이벤트의 시작과 종료 중 어느 시점을 정답으로 정의해야 하는가?
  • 희귀 이벤트의 오탐과 누락 중 현장에서는 어느 비용이 더 큰가?
  • 경기 전체를 처리할 때 속도와 정밀도 사이의 기준은 어떻게 정할 것인가?

SESSION MATERIALS

논문과 발표자료

2 FILES & LINKS

SDA Magazine 소개

SDA Magazine은 스포츠의 결과를 넘어 선택과 맥락을 데이터로 읽는 고려대학교 SDA의 분석 저널입니다.

이어서 읽기

전체 기사 →