Qwen 3.8 공개와 NVIDIA LLM 설계 지침 #84

Qwen 3.8 공개와 NVIDIA LLM 설계 지침 #84

오늘의 레터

  1. NVIDIA, 하드웨어 친화적 LLM 설계 지침 공개
  2. Alibaba Qwen, 2.4조 파라미터 Qwen 3.8 발표

NVIDIA, 하드웨어 친화적 LLM 설계 지침 공개

NVIDIA, 하드웨어 친화적 LLM 설계 지침 공개
  • NVIDIA가 7월 10일 Technical Blog를 통해 LLM 추론의 처리량과 응답성을 함께 높이기 위한 AI 모델 공동 설계 지침을 공개함
  • 선형 레이어 차원은 GPU 타일 크기에 맞는 128의 배수, 이상적으로 256 또는 512 정렬을 권장하며, 이에 가까운 정사각형 형태가 높은 GPU 사용률에 유리하다고 설명함
  • 모델 폭과 레이어 수의 비율, hidden dimension과 MLP intermediate projection dimension이 연산 집약도와 병렬화 효율, 멀티 GPU 확장성에 직접 영향을 준다고 정리함
  • NVFP4 양자화와 TensorRT Model Optimizer, LLM Compressor 조합으로 정확도 손실을 크게 늘리지 않으면서 Blackwell GPU의 처리량을 끌어올릴 수 있다고 소개함
  • 대규모 MoE 모델은 TensorRT-LLM의 expert parallelism, pipeline parallelism, Helix Parallelism으로 다중 노드 Blackwell NVLink 환경에 확장 가능하다고 설명함
  • 서비스 목표에 따라 최적화 지점도 다르다고 제시함. 긴 컨텍스트·처리량 중심 워크로드는 attention 비중이 크고, 지연 시간 중심 서빙은 병렬화 추가에 따른 통신 오버헤드를 함께 고려해야 한다고 밝힘
  • 예시로 attention이 전체 실행 시간의 77%를 차지하면 FFN 조정보다 attention 경로 최적화가 더 큰 효과를 낸다고 설명하며, 초기 모델 설계 단계부터 배포 하드웨어를 함께 고려할 것을 권장함

원문: developer.nvidia.com


Alibaba Qwen, 2.4조 파라미터 Qwen 3.8 발표

  • Alibaba Qwen이 2.4조 파라미터 규모의 Qwen 3.8을 공개하고, 오픈 웨이트도 추후 공개할 예정이라고 밝힘
  • Qwen 측은 Qwen 3.8을 지속적으로 개선 중인 모델로 소개하며, 프런티어급 AI 모델과의 호환성을 내세움
  • 체험 버전인 Qwen3.8-Max-Preview는 Alibaba Token Plan, Qoder, QoderWork에서 바로 사용할 수 있음
  • Alibaba Token Plan은 국제 사용자와 중국 사용자용 가격 페이지를 분리해 운영함
  • 국제 사용자용 요금제는 Lite·Standard·Pro 3단계이며, 프로모션 가격은 월 6달러·18달러·68달러
  • 요금제별로 7일당 2,500·10,000·40,000 Credits와 5시간당 700·3,000·12,000 Credits를 제공함
  • 동시에 실행 가능한 에이전트 수는 각 단계별로 1~2개, 3~4개, 6~8개 수준
  • OpenAI·Anthropic 프로토콜을 지원하는 도구에서는 API Key와 Base URL을 넣어 연결 가능

원문: news.hada.io
참고: officechai.com · bloomberg.com · scmp.com


조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.

#NVIDIA #Qwen

조코레터 구독하기

Read more

AI 모델 비용 절감과 에이전트 연결 표준 변화 #134

오늘의 레터 1. OpenAI, 우크라이나 민간 인프라 사이버 방어 지원 2. Anthropic, Claude Opus 5.5 공개 3. Databricks, Genie One MCP 정식 출시 OpenAI, 우크라이나 민간 인프라 사이버 방어 지원 * OpenAI가 우크라이나 정부에 Daybreak 프로그램을 제공해 민간 인프라 사이버 방어를 지원 * 우크라이나 디지털전환부와 협력해 소프트웨어 취약점 식별과 수정안 개발·

By TaeyoungPark