NVIDIA GB300 Qwen 모델 지원과 GitHub Copilot 업데이트 #123
오늘의 레터
NVIDIA, GB300용 Qwen3.8-Flash-Next 실험 지원

- Alibaba의 Qwen3.8-Flash-Next를 NVIDIA GB300 NVL72에서 에이전틱 코딩용으로 실행하는 방법 공개
- 125B 파라미터 MoE 모델이며 토큰당 6B 파라미터를 활성화하고, 51B 규모의 N-gram 임베딩을 추가로 지원
- 기본 262,144토큰 컨텍스트를 제공하며 YaRN 적용 시 최대 100만 토큰까지 확장
- 4개 레이어 중 3개는 Gated DeltaNet으로 과거 문맥을 압축하고, 나머지 1개는 Qwen Sparse Attention으로 필요한 영역을 검색
- Alibaba 벤치마크에서 100만 토큰 기준 전체 어텐션 대비 프리필 최대 7.6배, 디코딩 최대 4.9배 속도 향상
- GB300 NVL72에서 GPU당 초당 1만6천 토큰 이상, 사용자당 초당 200토큰 이상의 처리량을 기록
- SGLang, vLLM, TensorRT-LLM, TokenSpeed 추론 스택과 NeMo AutoModel·NeMo RL 학습 레시피를 제공
GitHub Copilot, Visual Studio 2026년 8월 업데이트
- GitHub가 Visual Studio 2026용 Copilot 8월 업데이트를 공개
- GitHub 조직·엔터프라이즈 소유자가 조직 전반에서 사용할 커스텀 에이전트를 게시 가능
- 지원 모델의 사고 수준을 Low·Medium·High로 조정해 작업 난이도와 토큰 사용량을 맞출 수 있음
- 모델 관리 화면에서 즐겨찾기 고정, 모델 접기, 기능·컨텍스트 창 크기·비용 정보 확인을 제공
- Copilot 사용량 화면에서 전체 플랜 정보와 한도 접근 상태를 확인 가능
- Git agent가 커밋 전 미커밋 변경 사항과 커밋을 검토하고 결과를 편집기와 Git Changes에 표시
- 검토 대상은 GitHub 및 Azure DevOps 저장소이며, 모든 GitHub Copilot 요금제에서 제공됨
원문: github.blog
조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.
#GitHub #NVIDIA