NVIDIA GB300 Qwen 모델 지원과 GitHub Copilot 업데이트 #123

오늘의 레터

  1. NVIDIA, GB300용 Qwen3.8-Flash-Next 실험 지원
  2. GitHub Copilot, Visual Studio 2026년 8월 업데이트

NVIDIA, GB300용 Qwen3.8-Flash-Next 실험 지원

NVIDIA, GB300용 Qwen3.8-Flash-Next 실험 지원
  • Alibaba의 Qwen3.8-Flash-Next를 NVIDIA GB300 NVL72에서 에이전틱 코딩용으로 실행하는 방법 공개
  • 125B 파라미터 MoE 모델이며 토큰당 6B 파라미터를 활성화하고, 51B 규모의 N-gram 임베딩을 추가로 지원
  • 기본 262,144토큰 컨텍스트를 제공하며 YaRN 적용 시 최대 100만 토큰까지 확장
  • 4개 레이어 중 3개는 Gated DeltaNet으로 과거 문맥을 압축하고, 나머지 1개는 Qwen Sparse Attention으로 필요한 영역을 검색
  • Alibaba 벤치마크에서 100만 토큰 기준 전체 어텐션 대비 프리필 최대 7.6배, 디코딩 최대 4.9배 속도 향상
  • GB300 NVL72에서 GPU당 초당 1만6천 토큰 이상, 사용자당 초당 200토큰 이상의 처리량을 기록
  • SGLang, vLLM, TensorRT-LLM, TokenSpeed 추론 스택과 NeMo AutoModel·NeMo RL 학습 레시피를 제공

원문: developer.nvidia.com


GitHub Copilot, Visual Studio 2026년 8월 업데이트

  • GitHub가 Visual Studio 2026용 Copilot 8월 업데이트를 공개
  • GitHub 조직·엔터프라이즈 소유자가 조직 전반에서 사용할 커스텀 에이전트를 게시 가능
  • 지원 모델의 사고 수준을 Low·Medium·High로 조정해 작업 난이도와 토큰 사용량을 맞출 수 있음
  • 모델 관리 화면에서 즐겨찾기 고정, 모델 접기, 기능·컨텍스트 창 크기·비용 정보 확인을 제공
  • Copilot 사용량 화면에서 전체 플랜 정보와 한도 접근 상태를 확인 가능
  • Git agent가 커밋 전 미커밋 변경 사항과 커밋을 검토하고 결과를 편집기와 Git Changes에 표시
  • 검토 대상은 GitHub 및 Azure DevOps 저장소이며, 모든 GitHub Copilot 요금제에서 제공됨

원문: github.blog


조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.

#GitHub #NVIDIA

조코레터 구독하기

Read more

AI 인프라와 개발 도구의 운영 업데이트 #121

오늘의 레터 1. NVIDIA, Qwen3.8-Flash-Next GB300 구동 지원 2. GitHub, 엔터프라이즈 플러그인 마켓플레이스 자동 업데이트 지원 NVIDIA, Qwen3.8-Flash-Next GB300 구동 지원 * Alibaba의 Qwen3.8-Flash-Next 가중치를 NVIDIA GB300 NVL72에서 실행하는 기술 지원 공개 * 125B 파라미터 MoE 모델로 토큰당 6B 파라미터를 활성화하며 51B N-gram 임베딩을 추가 * 기본 262,144토큰 컨텍스트를

By TaeyoungPark