Qwen 3.8 공개와 NVIDIA LLM 설계 지침 #84
오늘의 레터
NVIDIA, 하드웨어 친화적 LLM 설계 지침 공개

- NVIDIA가 7월 10일 Technical Blog를 통해 LLM 추론의 처리량과 응답성을 함께 높이기 위한 AI 모델 공동 설계 지침을 공개함
- 선형 레이어 차원은 GPU 타일 크기에 맞는 128의 배수, 이상적으로 256 또는 512 정렬을 권장하며, 이에 가까운 정사각형 형태가 높은 GPU 사용률에 유리하다고 설명함
- 모델 폭과 레이어 수의 비율, hidden dimension과 MLP intermediate projection dimension이 연산 집약도와 병렬화 효율, 멀티 GPU 확장성에 직접 영향을 준다고 정리함
- NVFP4 양자화와 TensorRT Model Optimizer, LLM Compressor 조합으로 정확도 손실을 크게 늘리지 않으면서 Blackwell GPU의 처리량을 끌어올릴 수 있다고 소개함
- 대규모 MoE 모델은 TensorRT-LLM의 expert parallelism, pipeline parallelism, Helix Parallelism으로 다중 노드 Blackwell NVLink 환경에 확장 가능하다고 설명함
- 서비스 목표에 따라 최적화 지점도 다르다고 제시함. 긴 컨텍스트·처리량 중심 워크로드는 attention 비중이 크고, 지연 시간 중심 서빙은 병렬화 추가에 따른 통신 오버헤드를 함께 고려해야 한다고 밝힘
- 예시로 attention이 전체 실행 시간의 77%를 차지하면 FFN 조정보다 attention 경로 최적화가 더 큰 효과를 낸다고 설명하며, 초기 모델 설계 단계부터 배포 하드웨어를 함께 고려할 것을 권장함
Alibaba Qwen, 2.4조 파라미터 Qwen 3.8 발표
- Alibaba Qwen이 2.4조 파라미터 규모의 Qwen 3.8을 공개하고, 오픈 웨이트도 추후 공개할 예정이라고 밝힘
- Qwen 측은 Qwen 3.8을 지속적으로 개선 중인 모델로 소개하며, 프런티어급 AI 모델과의 호환성을 내세움
- 체험 버전인 Qwen3.8-Max-Preview는 Alibaba Token Plan, Qoder, QoderWork에서 바로 사용할 수 있음
- Alibaba Token Plan은 국제 사용자와 중국 사용자용 가격 페이지를 분리해 운영함
- 국제 사용자용 요금제는 Lite·Standard·Pro 3단계이며, 프로모션 가격은 월 6달러·18달러·68달러
- 요금제별로 7일당 2,500·10,000·40,000 Credits와 5시간당 700·3,000·12,000 Credits를 제공함
- 동시에 실행 가능한 에이전트 수는 각 단계별로 1~2개, 3~4개, 6~8개 수준
- OpenAI·Anthropic 프로토콜을 지원하는 도구에서는 API Key와 Base URL을 넣어 연결 가능
원문: news.hada.io
참고: officechai.com · bloomberg.com · scmp.com
조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.
#NVIDIA #Qwen