FinMTEB: Finance Massive Text Embedding Benchmark
FinMTEB: Finance Massive Text Embedding Benchmark
Written By. Yixuan Tang , Yi Yang
1. 문제 정의
- 일반 벤치마크의 한계: 일반 도메인 벤치마크에서 뛰어난 성능을 보이는 대형 언어 모델(LLM) 기반 임베딩 모델이라도 금융과 같은 전문 분야에서는 성능 저하가 발생함.
- 금융 텍스트의 특이성: 전문 용어, 시간 민감성, 수치 관계, 상투적 공시 문구(보일러플레이트) 등으로 인해 일반 언어와 의미론적 차이가 큼.
- 평가 프레임워크 및 오픈소스 모델 부재: 기존 금융 평가 도구는 주로 텍스트 생성 능력에 치중되어 있으며, 오픈소스 기반의 금융 특화 LLM 임베딩 모델 및 종합 평가 벤치마크가 부재함.
2. 해결 방법
A. 금융 특화 평가 벤치마크: FinMTEB
- 데이터셋 구성: 영어 35개, 중국어 29개 등 총 64개 데이터셋으로 구성됨.
- 7가지 평가 과제:
- 의미적 텍스트 유사도 (STS): 연례 보고서, 은행 문장 등에서 미묘한 의미 변화 포착 (Spearman correlation 측정).
- 검색 : 수치, 시간, 규제 맥락을 반영한 질의응답 및 용어 사전(TheGoldman) 검색 (NDCG@10 측정).
- 클러스터링: arXiv 금융 논문, 기업 설명, 소비자 불만 등 유사 텍스트 그룹화 (V-measure 측정).
- Classification: 금융 감성, 통화정책(Hawkish/Dovish), 미래 예측 진술(FLS) 분류 등 (MAP 측정).
- Reranking: 질의 관련 문서 추출 후 상위 결과의 정밀 재정렬 (MAP 측정).
- Pair-Classification : 뉴스 헤드라인, 고객 의도 간 관계 판별 (AP 측정).
- 요약 : 임베딩 기반 요약본의 의미적 유사도 평가.
B. 금융 특화 임베딩 모델: Fin-E5
① 학습 데이터 구조: Triplet
- $(q, d^+, D^-)$ 형태의 대조 학습 구조를 설계함.
- $q$: 금융 질의.
- $d^+$: 질의에 실질적 정답 정보를 제공하는 합성 포지티브 문서.
- $D^-$: 금융 도메인 내에 존재하지만 의미적 의도가 다른 하드 네거티브 문서 집합.
② 페르소나 기반 데이터 증강 3단계
- 1단계: 페르소나 및 과제 식별
- InvestLM의 시드 QA 데이터를 활용,
Qwen2.5-14B-Instruct에 질문을 제공하고 “이 텍스트를 사용할 법한 인물”을 역추론함. - 결과물 예시: “주요 경제 지표 및 규제 영향을 추적하는 금융 기관의 준법감시인(Persona)”.
- InvestLM의 시드 QA 데이터를 활용,
- 2단계: Contextual Query Generation
- 식별된 페르소나 정보를 기반으로
Qwen2.5-72B-Instruct를 사용해 실제 업무상 던질 법한 질문 $q$를 합성함. - 외부 전문 문서 조회가 필수적인 질의만 엄격히 필터링함.
- 결과물 예시: “G7 중앙은행의 금리 인상이 상업은행 유동성 리스크 보고에 미치는 영향 분석”.
- 식별된 페르소나 정보를 기반으로
- 3단계: 합성 포지티브 문서 생성
- 생성된 질의 $q$에 대해
Qwen2.5-72B-Instruct를 사용하여 페르소나의 업무 요구에 부합하는 전문적이고 구체적인 맥락의 긍정 문서 $d^+$를 합성함.
- 생성된 질의 $q$에 대해
③ 하드 네거티브 채굴 및 데이터 검증
- 하드 네거티브 ($D^-$) 추출: 보조 임베딩 모델인
all-MiniLM-L12-v2를 이용해 임베딩 공간상 $q$와 가깝지만 실제 정답은 아닌 금융 문서들을 선별해 하드 네거티브로 배치함. - 데이터 오염 방지: FinMTEB 평가 데이터셋과의 중복 여부를 사전에 철저히 검증하여 데이터 오염을 차단함.
④ 모델 학습 및 파인튜닝 파이프라인
- 기반 모델:
e5-mistral-7b-instruct모델을 백본으로 사용함. - Instruction Template:
Qinst Instruct: {task_definition}\n{q}구성을 통해 과제 정의를 명확히 주입함.
- Loss Function:
- InfoNCE Loss를 사용함.
- 배치 내 네거티브 샘플(In-batch negatives) 및 마이닝한 하드 네거티브 중에서 $q$의 임베딩이 $d^+$의 임베딩과 가장 가까워지도록 거리를 축소함.
- 풀링 및 하이퍼파라미터 설정:
- Pooling: Last token pooling 적용.
- Training Size: 총 19,467개 데이터셋.
- Batch Size / Learning Rate: Batch size 128, AdamW 최적화 도구(Learning Rate 1e-5, Linear Warmup) 적용.
- Optimization: 단 100 Step만의 파인튜닝으로 컴퓨팅 자원을 절감하면서 효율성 확보함.
3. 실험
- 평가 대상: Bag-of-Words(BoW), 인코더 기반(BERT, FinBERT 등), LLM 기반(bge-en-icl, NV-Embed v2 등), 상용 모델(OpenAI text-embedding-3, Voyage-3-large 등) 총 15개 모델을 평가함.
- 주요 실험 결과:
- 도메인 적응 효과: Fin-E5가 평균 0.6767점을 기록하며 최신 상용 모델 및 LLM 기반 모델들을 제치고 종합 1위(SOTA)를 달성함. 특히 분류($p=0.0206$) 및 검색($p=0.0489$) 과제에서 통계적으로 유의미한 성능 향상을 입증함.
- 금융 STS 과제의 반전: 단어 빈도 기반의 BoW(Bag-of-Words) 모델(0.4845)이 모든 밀집(Dense) 임베딩 모델을 능가함. 이는 정확한 단어 매칭(Exact term match)이 중요한 금융 공시 문서의 특성을 기존 밀집 임베딩이 제대로 반영하지 못함을 나타냄.
- ANOVA 검정 결과: 일반 MTEB 성적과 FinMTEB 성적 간 스피어만 상관계수는 통계적 유의성이 없음($p > 0.05$)을 확인함. ANOVA 분산 분석 결과 ‘도메인 요인(Domain Factor)’이 모델 성과 차이에 매우 높은 유의성($p < 0.001$)을 가짐을 검증함.
4. 결론 (Conclusion)
- 금융 임베딩 평가를 위한 최초의 종합 벤치마크인 FinMTEB(64개 데이터셋)를 구축함.
- 페르소나 기반 데이터 증강 방식을 통해 100 Step의 효율적인 튜닝으로 SOTA 성능을 내는 Fin-E5 모델을 개발함.
- 일반 도메인 평가 성과가 전문 금융 도메인 성과를 보장하지 못함을 실증적으로 입증함.
- 연구 생태계 기여를 위해 FinMTEB 벤치마크 및 Fin-E5 모델을 오픈소스로 공개함.
This post is licensed under CC BY 4.0 by the author.