Post

FinMTEB: Finance Massive Text Embedding Benchmark

FinMTEB: Finance Massive Text Embedding Benchmark

Written By. Yixuan Tang , Yi Yang

1. 문제 정의

  • 일반 벤치마크의 한계: 일반 도메인 벤치마크에서 뛰어난 성능을 보이는 대형 언어 모델(LLM) 기반 임베딩 모델이라도 금융과 같은 전문 분야에서는 성능 저하가 발생함.
  • 금융 텍스트의 특이성: 전문 용어, 시간 민감성, 수치 관계, 상투적 공시 문구(보일러플레이트) 등으로 인해 일반 언어와 의미론적 차이가 큼.
  • 평가 프레임워크 및 오픈소스 모델 부재: 기존 금융 평가 도구는 주로 텍스트 생성 능력에 치중되어 있으며, 오픈소스 기반의 금융 특화 LLM 임베딩 모델 및 종합 평가 벤치마크가 부재함.

2. 해결 방법

A. 금융 특화 평가 벤치마크: FinMTEB

  • 데이터셋 구성: 영어 35개, 중국어 29개 등 총 64개 데이터셋으로 구성됨.
  • 7가지 평가 과제:
    • 의미적 텍스트 유사도 (STS): 연례 보고서, 은행 문장 등에서 미묘한 의미 변화 포착 (Spearman correlation 측정).
    • 검색 : 수치, 시간, 규제 맥락을 반영한 질의응답 및 용어 사전(TheGoldman) 검색 (NDCG@10 측정).
    • 클러스터링: arXiv 금융 논문, 기업 설명, 소비자 불만 등 유사 텍스트 그룹화 (V-measure 측정).
    • Classification: 금융 감성, 통화정책(Hawkish/Dovish), 미래 예측 진술(FLS) 분류 등 (MAP 측정).
    • Reranking: 질의 관련 문서 추출 후 상위 결과의 정밀 재정렬 (MAP 측정).
    • Pair-Classification : 뉴스 헤드라인, 고객 의도 간 관계 판별 (AP 측정).
    • 요약 : 임베딩 기반 요약본의 의미적 유사도 평가.

B. 금융 특화 임베딩 모델: Fin-E5

① 학습 데이터 구조: Triplet

  • $(q, d^+, D^-)$ 형태의 대조 학습 구조를 설계함.
    • $q$: 금융 질의.
    • $d^+$: 질의에 실질적 정답 정보를 제공하는 합성 포지티브 문서.
    • $D^-$: 금융 도메인 내에 존재하지만 의미적 의도가 다른 하드 네거티브 문서 집합.

② 페르소나 기반 데이터 증강 3단계

  • 1단계: 페르소나 및 과제 식별
    • InvestLM의 시드 QA 데이터를 활용, Qwen2.5-14B-Instruct에 질문을 제공하고 “이 텍스트를 사용할 법한 인물”을 역추론함.
    • 결과물 예시: “주요 경제 지표 및 규제 영향을 추적하는 금융 기관의 준법감시인(Persona)”.
  • 2단계: Contextual Query Generation
    • 식별된 페르소나 정보를 기반으로 Qwen2.5-72B-Instruct를 사용해 실제 업무상 던질 법한 질문 $q$를 합성함.
    • 외부 전문 문서 조회가 필수적인 질의만 엄격히 필터링함.
    • 결과물 예시: “G7 중앙은행의 금리 인상이 상업은행 유동성 리스크 보고에 미치는 영향 분석”.
  • 3단계: 합성 포지티브 문서 생성
    • 생성된 질의 $q$에 대해 Qwen2.5-72B-Instruct를 사용하여 페르소나의 업무 요구에 부합하는 전문적이고 구체적인 맥락의 긍정 문서 $d^+$를 합성함.

③ 하드 네거티브 채굴 및 데이터 검증

  • 하드 네거티브 ($D^-$) 추출: 보조 임베딩 모델인 all-MiniLM-L12-v2를 이용해 임베딩 공간상 $q$와 가깝지만 실제 정답은 아닌 금융 문서들을 선별해 하드 네거티브로 배치함.
  • 데이터 오염 방지: FinMTEB 평가 데이터셋과의 중복 여부를 사전에 철저히 검증하여 데이터 오염을 차단함.

④ 모델 학습 및 파인튜닝 파이프라인

  • 기반 모델: e5-mistral-7b-instruct 모델을 백본으로 사용함.
  • Instruction Template:
    • Qinst Instruct: {task_definition}\n{q} 구성을 통해 과제 정의를 명확히 주입함.
  • Loss Function:
    • InfoNCE Loss를 사용함.
    • 배치 내 네거티브 샘플(In-batch negatives) 및 마이닝한 하드 네거티브 중에서 $q$의 임베딩이 $d^+$의 임베딩과 가장 가까워지도록 거리를 축소함.
  • 풀링 및 하이퍼파라미터 설정:
    • Pooling: Last token pooling 적용.
    • Training Size: 총 19,467개 데이터셋.
    • Batch Size / Learning Rate: Batch size 128, AdamW 최적화 도구(Learning Rate 1e-5, Linear Warmup) 적용.
    • Optimization:100 Step만의 파인튜닝으로 컴퓨팅 자원을 절감하면서 효율성 확보함.

3. 실험

  • 평가 대상: Bag-of-Words(BoW), 인코더 기반(BERT, FinBERT 등), LLM 기반(bge-en-icl, NV-Embed v2 등), 상용 모델(OpenAI text-embedding-3, Voyage-3-large 등) 총 15개 모델을 평가함.
  • 주요 실험 결과:
    1. 도메인 적응 효과: Fin-E5가 평균 0.6767점을 기록하며 최신 상용 모델 및 LLM 기반 모델들을 제치고 종합 1위(SOTA)를 달성함. 특히 분류($p=0.0206$) 및 검색($p=0.0489$) 과제에서 통계적으로 유의미한 성능 향상을 입증함.
    2. 금융 STS 과제의 반전: 단어 빈도 기반의 BoW(Bag-of-Words) 모델(0.4845)이 모든 밀집(Dense) 임베딩 모델을 능가함. 이는 정확한 단어 매칭(Exact term match)이 중요한 금융 공시 문서의 특성을 기존 밀집 임베딩이 제대로 반영하지 못함을 나타냄.
    3. ANOVA 검정 결과: 일반 MTEB 성적과 FinMTEB 성적 간 스피어만 상관계수는 통계적 유의성이 없음($p > 0.05$)을 확인함. ANOVA 분산 분석 결과 ‘도메인 요인(Domain Factor)’이 모델 성과 차이에 매우 높은 유의성($p < 0.001$)을 가짐을 검증함.

4. 결론 (Conclusion)

  • 금융 임베딩 평가를 위한 최초의 종합 벤치마크인 FinMTEB(64개 데이터셋)를 구축함.
  • 페르소나 기반 데이터 증강 방식을 통해 100 Step의 효율적인 튜닝으로 SOTA 성능을 내는 Fin-E5 모델을 개발함.
  • 일반 도메인 평가 성과가 전문 금융 도메인 성과를 보장하지 못함을 실증적으로 입증함.
  • 연구 생태계 기여를 위해 FinMTEB 벤치마크 및 Fin-E5 모델을 오픈소스로 공개함.
This post is licensed under CC BY 4.0 by the author.