MultiVectorEncoder와 Codex로 달라지는 개발 방식 #120
오늘의 레터
Hugging Face, MultiVectorEncoder 학습 지원 공개

- Sentence Transformers v6.0에 ColBERT 방식의 지연 상호작용 검색을 위한 네 번째 모델 유형 MultiVectorEncoder 추가
- `sentence-transformers[train]` 패키지로 모델·데이터셋·손실 함수·평가기·Trainer를 포함한 학습 과정 제공
- 문서 전체를 단일 벡터로 압축하지 않고 토큰별 벡터를 유지하며, MaxSim으로 질의 토큰과 문서 토큰을 비교
- 토큰 단위 신호를 보존해 도메인별 검색 품질을 높일 수 있지만 벡터 인덱스 크기는 증가
- 기존 검색 모델은 문서를 180~300토큰 또는 256~512토큰으로 자르는 경우가 있어 긴 문서의 정보가 제외됨
- 평균 941토큰 의료 문서 평가에서 문서 절단으로 NDCG@10이 최대 0.24 낮아질 수 있다고 설명
- 단일 RTX 3090에서 14.5시간 학습한 `mLateOn-medical`이 의료 검색 평가에서 범용 검색 모델을 상회
원문: huggingface.co
loveholidays, Codex로 전사 개발 참여 확대

- OpenAI가 2026년 8월 26일 온라인 여행사 loveholidays의 Codex 도입 사례를 공개
- 제품 관리자, 디자이너, 커머셜 팀이 엔지니어링 대기열 없이 코드베이스와 고객 경험을 직접 수정
- Search Playground에서 회사 디자인 시스템과 프론트엔드 기술을 사용해 10개 이상의 검색 경험을 개발했으며, 3개 이상이 웹사이트에서 운영 중
- Codex 워크플로에 엔지니어링 모범 사례·검증 절차를 입력해 변경 제안, 점검, 배포 과정을 안내
- Data Platform의 AI 지원 변경 성공률은 58%에서 93%로 상승했고, 지원 요청당 변경 건수는 4배 증가
- AI 지원 코드 변경 비율은 1년 사이 7%에서 79%로 늘었으며, 엔지니어링 인력 규모를 유지한 채 배포 빈도는 73% 증가
- 클라우드 스토리지 비용 연 3만6천 파운드와 데이터 처리 낭비 비용 연 약 10만 파운드를 절감
원문: openai.com
조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.
#HuggingFace #OpenAI