Just Do It
텍스트 임베딩 · 검색

FinMTEB: Finance Massive Text Embedding Benchmark

Written By. Yixuan Tang , Yi Yang 1. 문제 정의 일반 벤치마크의 한계: 일반 도메인 벤치마크에서 뛰어난 성능을 보이는 대형 언어 모델(LLM) 기반 임베딩 모델이라도 금융과 같은 전문 분야에서는 성능 저하가 발생함. 금융 텍스트의 특이성: 전문 용어, 시간 민감성, 수치 관계, 상투적 공시 문구(보일러플레이트)...

멀티모달 임베딩 · 검색

MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction

Written By. Zilin Xiao, Qi Ma, Mengting Gu 1. 문제 정의 멀티모달 검색의 기본 접근의 병목: “표현력 vs 효율” 트레이드오프 (A) Single-vector 임베딩 쿼리/후보를 각각 “하나의 벡터”로 압축하면 인덱스/서치가 매우 효율적이지만, 멀티모달에서 중요한 fine-grained(...

멀티모달 임베딩 · 검색

Beyond Matryoshka: Revisiting Sparse Coding for Adaptive Representation

Written By. Tiansheng Wen, Yifei Wang, Zequn Zeng 1. 문제 정의 1.1. 배경: Adaptive Embedding이 필요한 이유 정보 검색(search), RAG, 벡터DB에서 임베딩의 길이는 성능과 비용을 결정하는 핵심 파라미터다. 긴 embedding → 정확도↑, 계산량↑, 비용↑ 짧은 e...

멀티모달 임베딩 · 검색

Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment

Written By. Pengfei Zhao, Rongbo Luan, Wei Zhang (APPLE) 배경 및 문제의식 1-1. 크로스모달 리트리벌과 모달리티 갭 문제 CLIP류 모델은 대규모 이미지–텍스트 쌍으로 contrastive learning을 수행해 좋은 성능을 보이지만, 여전히 모달리티 갭(modality gap) 이 존재: ...

멀티모달 임베딩 · 검색

CLIP-MoE: Towards Building Mixture of Experts for CLIP with Diversified Multiplet Upcycling

Written By. Jihai Zhang, Xiaoye Qu 1. 문제 정의: 기존 CLIP의 구조적 한계 기존 CLIP은 강력하지만 다음과 같은 근본적 한계가 있음: CLIP은 feature space의 일부만 사용 특정 시멘틱 정보(예: 색)에는 민감하지만 texture·shape·orientation 등 다른 feature를 잘 못...

멀티모달 임베딩 · 검색

SMEC: Rethinking Matryoshka Representation Learning for Retrieval Embedding Compression

Written By. Biao Zhang, Lixin Chen, Tong Liu 배경 및 문제 정의 LLM은 문맥을 잘 이해하고 표현하기 위해 고차원 임베딩(예: 1024~4096 차원)을 생성하지만 아래와 같은 문제 존재: 저장 비용 증가 실시간 검색 시 연산량 급증 차원의 저주(Curse of Dimensionality)로 인한 ...

텍스트 임베딩 · 검색

Randomly Removing 50% of Dimensions in Text Embeddings has Minimal Impact on Retrieval and Classification Tasks

2025 EMNLP Oral Written By. Sotaro Takeshita, Yurina Takeshita, Daniel Ruffinelli, Simone Paolo Ponzetto 1. 연구 개요 텍스트 임베딩의 차원을 무작위로 제거했을 때 다운스트림 작업(검색·분류·생성)의 성능에 어떤 영향을 미치는지를 체계적으로 분석 주요 관찰...

텍스트 임베딩 · 검색

Training LLMs to be Better Text Embedders through Bidirectional Reconstruction

Written By. Chang Su, Dengliang Shi, Siyuan Huang, Jintao Du 배경 및 문제점 기존의 LLM 기반 임베딩 기법은 주로 [EOS]와 같은 마지막 토큰의 임베딩을 전체 문장의 대표 벡터로 사용 하지만 이 [EOS] 토큰은 pretraining 중에 의미 정보를 담도록 학습되지 않기 때문에, inf...

멀티모달 임베딩 · 검색

Differential-informed Sample Selection Accelerates Multimodal Contrastive Learning

Written by. Zihua Zhao, Feng Hong, Mengxi Chen 논문 개요 및 배경 이미지-텍스트 쌍을 위한 대규모 contrastive learning은 성능이 뛰어나지만 학습 비용이 매우 큼. 학습 효율성을 높이기 위한 방법으로 sample selection이 주목받고 있음 기존 방식은: 오프...

멀티모달 임베딩 · 검색

Aligning Information Capacity Between Vision and Language via Dense-to-Sparse Feature Distillation for Image-Text Matching

Written by. Yang Liu, Wentao Feng, Zhuoyao Liu 개요 이 논문은 이미지-텍스트 매칭(Image-Text Matching, ITM) 성능을 향상시키기 위해 텍스트 임베딩의 정보량(Information Capacity)에 주목 기존 방법들이 짧고 간결한 텍스트에만 의존하여 시멘틱 정렬을 시도하는 한계를 극복...

텍스트 임베딩 · 검색

Negative Matters: Multi-Granularity Hard-Negative Synthesis and Anchor-Token-Aware Pooling for Enhanced Text Embeddings

Written by. Tengyu Pan, Zhichao Duan, Zhenyu Li 1. 연구 배경 텍스트 임베딩 모델은 문장을 벡터로 변환해 의미적 유사도를 계산하는 데 핵심적 역할. 일반적으로 (query, positive, negative) 구조로 contrastive learning으로 학습되며, 특히 hard negative의 ...

신뢰성 · 평가

Quantifying Uncertainty in Answers from Any Language Model and Enhancing Their Trustworthiness

Written by. Jiuhai Chen, Jonas Mueller 배경 및 문제의식 LLM은 강력한 성능을 보이지만, 여전히 신뢰성 부족으로 인해 고위험(high-stakes) 분야에 사용하기 힘듬. 특히 hallucination 문제로 인해 그럴듯하지만 틀린 답변을 자주 생성함. 기존 불확실성 추정(uncertainty estim...

신뢰성 · 평가

Chain-of-Thought Prompting Obscures Hallucination Cues in Large Language Models: An Empirical Evaluation

Written by. Jiahao Cheng, Tiancheng Su, Jia Yuan1, Guoxiu He 연구 목적 CoT prompting은 LLM의 추론력을 향상시키고 할루시네이션 빈도를 줄이지만, 그 과정에서 할루시네이션를 감지하는 데 사용되는 내부 신호를 흐리게 만들어 기존의 detection 기법을 덜 효과적으로 만든다는 가설을 검증....

LLM 학습 · 효율화

SCAR: Data Selection via Style Consistency-Aware Response Ranking for Efficient Instruction-Tuning of Large Language Models

Written by. Zhuang Li1, Yuncheng Hua2 1. 연구 배경과 문제의식 동기: 기존 연구는 적은 수의 고품질 데이터로도 대규모 데이터보다 성능이 더 좋을 수 있다고 밝혔지만, “스타일 일관성”의 정의가 데이터 품질에 영향을 미친다는 연구는 없었음. 핵심 아이디어: 훈련 데이터 내 응답 스타일의 일관성이 LLM 성능 ...

LLM 에이전트

Re-Invoke: Tool Invocation Rewriting for Zero-Shot Tool Retrieval

Written by. Google AI Team 문제 정의 LLM은 다양한 API와 도구를 호출하며 외부 기능을 활용하지만, 툴셋이 커질수록 적절한 툴을 고르는 것이 어렵고 성능 저하가 발생하고 그에 대한 이유: 토큰 길이 제한 – 수천 개의 툴을 프롬프트에 모두 포함 불가능. 변화하는 툴셋 – 툴이 자주 업데이트되어 레이블 유지가 ...