AI 인프라와 개발 도구의 운영 업데이트 #121

오늘의 레터

  1. NVIDIA, Qwen3.8-Flash-Next GB300 구동 지원
  2. GitHub, 엔터프라이즈 플러그인 마켓플레이스 자동 업데이트 지원

NVIDIA, Qwen3.8-Flash-Next GB300 구동 지원

NVIDIA, Qwen3.8-Flash-Next GB300 구동 지원
  • Alibaba의 Qwen3.8-Flash-Next 가중치를 NVIDIA GB300 NVL72에서 실행하는 기술 지원 공개
  • 125B 파라미터 MoE 모델로 토큰당 6B 파라미터를 활성화하며 51B N-gram 임베딩을 추가
  • 기본 262,144토큰 컨텍스트를 제공하고 YaRN으로 최대 100만 토큰까지 확장
  • 4개 레이어 중 3개는 Gated DeltaNet, 나머지는 Qwen Sparse Attention을 사용해 장문 처리 구조 구성
  • 100만 토큰 벤치마크에서 전체 어텐션 대비 프리필 최대 7.6배, 디코딩 최대 4.9배 향상
  • GB300 NVL72에서 GPU당 초당 1만6천 토큰 이상, 사용자당 초당 200토큰 이상 처리
  • NVIDIA NeMo AutoModel·NeMo RL과 SGLang·vLLM·TokenSpeed 레시피를 지원하며 QwenCloud와 Hugging Face에서 시작 가능

원문: developer.nvidia.com


GitHub, 엔터프라이즈 플러그인 마켓플레이스 자동 업데이트 지원

  • 엔터프라이즈 관리 설정에서 플러그인 마켓플레이스별 자동 업데이트 기능을 지원
  • extraKnownMarketplaces 항목에 autoUpdate: true를 지정하면 해당 마켓플레이스의 플러그인을 자동 갱신
  • 지원 클라이언트가 마켓플레이스를 자동 확인하고 설치된 플러그인을 업데이트
  • 자동 업데이트 대상 마켓플레이스도 유효한 strictKnownMarketplaces 허용 목록에 포함되어야 함
  • 조직별 커스텀 플러그인의 수동 유지보수 부담을 줄이는 방식
  • GitHub Copilot Business와 Copilot Enterprise에서 일반 제공되며 GitHub Copilot 앱, Copilot CLI, Visual Studio Code에서 지원

원문: github.blog


조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.

#GitHub #NVIDIA

조코레터 구독하기

Read more

MultiVectorEncoder와 Codex로 달라지는 개발 방식 #120

오늘의 레터 1. Hugging Face, MultiVectorEncoder 학습 지원 공개 2. loveholidays, Codex로 전사 개발 참여 확대 Hugging Face, MultiVectorEncoder 학습 지원 공개 * Sentence Transformers v6.0에 ColBERT 방식의 지연 상호작용 검색을 위한 네 번째 모델 유형 MultiVectorEncoder 추가 * `sentence-transformers[train]` 패키지로 모델·데이터셋·손실 함수·평가기·Trainer를 포함한 학습 과정

By TaeyoungPark

Vercel Sandbox 리전 확대와 Microsoft 데이터 삭제 #118

오늘의 레터 1. Vercel Sandbox, 글로벌 리전 지원 시작 2. Microsoft, 비영리 라이선스 종료 뒤 데이터 삭제 발생 Vercel Sandbox, 글로벌 리전 지원 시작 * Vercel Sandbox가 전 세계 서비스로 확대되며 4개 리전에서 실행 지원 * 초기 지원 리전은 워싱턴 D.C. iad1, 샌프란시스코 sfo1, 클리블랜드 cle1, 파리 cdg1 * 기본 리전은 iad1이며

By TaeyoungPark