AI 인프라와 개발 도구의 운영 업데이트 #121
오늘의 레터
NVIDIA, Qwen3.8-Flash-Next GB300 구동 지원

- Alibaba의 Qwen3.8-Flash-Next 가중치를 NVIDIA GB300 NVL72에서 실행하는 기술 지원 공개
- 125B 파라미터 MoE 모델로 토큰당 6B 파라미터를 활성화하며 51B N-gram 임베딩을 추가
- 기본 262,144토큰 컨텍스트를 제공하고 YaRN으로 최대 100만 토큰까지 확장
- 4개 레이어 중 3개는 Gated DeltaNet, 나머지는 Qwen Sparse Attention을 사용해 장문 처리 구조 구성
- 100만 토큰 벤치마크에서 전체 어텐션 대비 프리필 최대 7.6배, 디코딩 최대 4.9배 향상
- GB300 NVL72에서 GPU당 초당 1만6천 토큰 이상, 사용자당 초당 200토큰 이상 처리
- NVIDIA NeMo AutoModel·NeMo RL과 SGLang·vLLM·TokenSpeed 레시피를 지원하며 QwenCloud와 Hugging Face에서 시작 가능
GitHub, 엔터프라이즈 플러그인 마켓플레이스 자동 업데이트 지원
- 엔터프라이즈 관리 설정에서 플러그인 마켓플레이스별 자동 업데이트 기능을 지원
- extraKnownMarketplaces 항목에 autoUpdate: true를 지정하면 해당 마켓플레이스의 플러그인을 자동 갱신
- 지원 클라이언트가 마켓플레이스를 자동 확인하고 설치된 플러그인을 업데이트
- 자동 업데이트 대상 마켓플레이스도 유효한 strictKnownMarketplaces 허용 목록에 포함되어야 함
- 조직별 커스텀 플러그인의 수동 유지보수 부담을 줄이는 방식
- GitHub Copilot Business와 Copilot Enterprise에서 일반 제공되며 GitHub Copilot 앱, Copilot CLI, Visual Studio Code에서 지원
원문: github.blog
조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.
#GitHub #NVIDIA