Qwen 3.8 공개와 NVIDIA LLM 설계 지침 #84

Qwen 3.8 공개와 NVIDIA LLM 설계 지침 #84

오늘의 레터

  1. NVIDIA, 하드웨어 친화적 LLM 설계 지침 공개
  2. Alibaba Qwen, 2.4조 파라미터 Qwen 3.8 발표

NVIDIA, 하드웨어 친화적 LLM 설계 지침 공개

NVIDIA, 하드웨어 친화적 LLM 설계 지침 공개
  • NVIDIA가 7월 10일 Technical Blog를 통해 LLM 추론의 처리량과 응답성을 함께 높이기 위한 AI 모델 공동 설계 지침을 공개함
  • 선형 레이어 차원은 GPU 타일 크기에 맞는 128의 배수, 이상적으로 256 또는 512 정렬을 권장하며, 이에 가까운 정사각형 형태가 높은 GPU 사용률에 유리하다고 설명함
  • 모델 폭과 레이어 수의 비율, hidden dimension과 MLP intermediate projection dimension이 연산 집약도와 병렬화 효율, 멀티 GPU 확장성에 직접 영향을 준다고 정리함
  • NVFP4 양자화와 TensorRT Model Optimizer, LLM Compressor 조합으로 정확도 손실을 크게 늘리지 않으면서 Blackwell GPU의 처리량을 끌어올릴 수 있다고 소개함
  • 대규모 MoE 모델은 TensorRT-LLM의 expert parallelism, pipeline parallelism, Helix Parallelism으로 다중 노드 Blackwell NVLink 환경에 확장 가능하다고 설명함
  • 서비스 목표에 따라 최적화 지점도 다르다고 제시함. 긴 컨텍스트·처리량 중심 워크로드는 attention 비중이 크고, 지연 시간 중심 서빙은 병렬화 추가에 따른 통신 오버헤드를 함께 고려해야 한다고 밝힘
  • 예시로 attention이 전체 실행 시간의 77%를 차지하면 FFN 조정보다 attention 경로 최적화가 더 큰 효과를 낸다고 설명하며, 초기 모델 설계 단계부터 배포 하드웨어를 함께 고려할 것을 권장함

원문: developer.nvidia.com


Alibaba Qwen, 2.4조 파라미터 Qwen 3.8 발표

  • Alibaba Qwen이 2.4조 파라미터 규모의 Qwen 3.8을 공개하고, 오픈 웨이트도 추후 공개할 예정이라고 밝힘
  • Qwen 측은 Qwen 3.8을 지속적으로 개선 중인 모델로 소개하며, 프런티어급 AI 모델과의 호환성을 내세움
  • 체험 버전인 Qwen3.8-Max-Preview는 Alibaba Token Plan, Qoder, QoderWork에서 바로 사용할 수 있음
  • Alibaba Token Plan은 국제 사용자와 중국 사용자용 가격 페이지를 분리해 운영함
  • 국제 사용자용 요금제는 Lite·Standard·Pro 3단계이며, 프로모션 가격은 월 6달러·18달러·68달러
  • 요금제별로 7일당 2,500·10,000·40,000 Credits와 5시간당 700·3,000·12,000 Credits를 제공함
  • 동시에 실행 가능한 에이전트 수는 각 단계별로 1~2개, 3~4개, 6~8개 수준
  • OpenAI·Anthropic 프로토콜을 지원하는 도구에서는 API Key와 Base URL을 넣어 연결 가능

원문: news.hada.io
참고: officechai.com · bloomberg.com · scmp.com


조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.

#NVIDIA #Qwen

조코레터 구독하기

Read more

암호화 AI 컴파일러와 CDN 보안 업데이트 #110

오늘의 레터 1. Google, 동형 암호화 AI 컴파일러 HEIR 공개 2. Vercel CDN, Encrypted Client Hello 지원 Google, 동형 암호화 AI 컴파일러 HEIR 공개 * Google이 Private Computing Toolkit에 오픈소스 동형 암호화 컴파일러 HEIR를 추가 * HEIR는 비암호화 입력을 처리하던 사전 학습 AI 모델을 암호화 입력 기반 추론 모델로 변환 * 동형 암호화는

By TaeyoungPark

AI 생성물 출처 표기와 시스템 개발 도구 공개 #107

오늘의 레터 1. Anthropic, Claude 생성 텍스트 워터마크 적용 2. Modular, Mojo 프로그래밍 언어 1.0 공개 Anthropic, Claude 생성 텍스트 워터마크 적용 * Anthropic이 Claude를 포함한 AI 모델 생성 텍스트에 워터마크를 적용한다고 지원 페이지에서 밝힘 * 2026년 8월 2일 이후 출시된 모델은 생성 텍스트와 파일에 워터마크 기술을 자동 적용 * 파일 워터마크에는

By TaeyoungPark