대규모 오픈 모델과 엔터프라이즈 개발 도구 업데이트 #119
오늘의 레터
NVIDIA, GB300 NVL72에서 Qwen3.8-2.4T-A95B 구동

- Alibaba의 2.4T 파라미터 오픈 웨이트 모델 Qwen3.8-2.4T-A95B를 NVIDIA GB300 NVL72에서 구동하는 레시피 공개
- 전체 파라미터는 2.4T이며 토큰당 95B를 활성화하는 세밀한 혼합 전문가(MoE) 구조
- 최대 100만 토큰 컨텍스트와 최대 128K 출력 길이를 지원해 코딩, 대규모 문서 분석, 장기 에이전트 작업에 대응
- 선형 어텐션과 전체 어텐션을 결합해 컨텍스트 증가에 따른 KV 캐시 메모리 부담을 제한
- FP8 기준 GPU당 초당 4K 토큰 이상, 사용자당 초당 350 토큰 이상의 처리량을 제시
- low·high·xhigh 추론 설정으로 요청별 연산량과 추론 깊이를 조절할 수 있으며 SGLang, vLLM, NVIDIA Dynamo, NIM 배포 경로를 제공
Vercel, Chat SDK의 Slack Enterprise Grid 지원
- Chat SDK의 Slack 어댑터가 Slack Enterprise Grid 지원을 추가함
- 조직 전체에 설치된 봇이 모든 워크스페이스에서 작동하도록 토큰 처리와 이벤트 라우팅을 조정함
- 조직 전체 설치 정보를 enterprise ID로 저장하고 SlackInstallation에 teamId, enterpriseId, isEnterpriseInstall 필드를 제공함
- HTTP 웹훅과 Socket Mode에서 동일한 토큰 해석을 적용하며 Slack Connect 공유 채널의 이벤트 라우팅을 지원함
- 사용자 프로필·멘션 캐시는 설치 단위로 분리하고 조직 토큰 API 요청에는 이벤트의 team_id를 자동 전달함
- Slack Delayed Events 재전송 이벤트를 24시간 동안 중복 제거함
- W 접두사 Grid 사용자 ID 멘션을 지원하며 기존 단일 워크스페이스 설치 기능은 그대로 유지됨
원문: vercel.com
조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.
#NVIDIA #Vercel