AI 추론 성능과 개발 도구 지표 업데이트 #61

AI 추론 성능과 개발 도구 지표 업데이트 #61

오늘의 레터

  1. NVIDIA, Blackwell용 DFlash 추론 가속 공개
  2. GitHub, Copilot 도입 단계별 PR 병합 총계 추가

NVIDIA, Blackwell용 DFlash 추론 가속 공개

NVIDIA, Blackwell용 DFlash 추론 가속 공개
  • NVIDIA가 Blackwell GPU용 speculative decoding 모델 DFlash를 공개하고, LLM 추론 처리량을 최대 15배 높일 수 있다고 소개함
  • DFlash는 경량 drafter가 토큰을 순차 생성하는 대신 후보 토큰 블록 전체를 한 번에 만들고, target 모델이 이를 병렬 검증하는 구조임
  • 8개 NVIDIA DGX B300 기반 TensorRT-LLM 구성에서 gpt-oss-120b는 사용자당 500~600 tokens/sec 구간에서 autoregressive decoding 대비 15배 이상 높은 처리량을 기록함
  • 같은 조건에서 EAGLE-3 speculative decoding 대비 처리량은 1.5배 높았고, batch size 1의 최저 동시성 구간에서는 interactivity가 2배 이상 개선됐다고 설명함
  • NVIDIA는 Llama 3.1 8B 기준으로도 같은 동시성에서 EAGLE-3 대비 interactivity가 거의 2배 수준으로 개선됐다고 밝힘
  • 연구팀은 Hugging Face에 DFlash 체크포인트 20종을 공개했고, NVIDIA Blackwell·Hopper용 레시피도 함께 제공함
  • NVIDIA는 DFlash가 SGLang, vLLM, TensorRT-LLM 등 주요 추론 스택에 확장되고 있어 기존 개발 워크플로에 큰 코드 수정 없이 적용할 수 있다고 설명함
  • 관련 논문은 2026년 2월 공개됐고, 이번 글은 2026년 6월 23일 NVIDIA Technical Blog에 게시됨

원문: developer.nvidia.com


GitHub, Copilot 도입 단계별 PR 병합 총계 추가

GitHub, Copilot 도입 단계별 PR 병합 총계 추가
  • GitHub가 2026년 6월 26일 Changelog에서 조직·엔터프라이즈 리포트에 AI 도입 단계별 pull request 병합 총계를 추가함
  • 기존 totals_by_ai_adoption_phase 항목은 사용자당 평균값만 제공했지만, 이제 일자별 total_pull_requests_merged 값을 함께 제공함
  • 새 지표는 기존 avg_pull_requests_merged를 보완하는 항목으로, 1일 리포트와 28일 리포트에서 모두 확인 가능함
  • 각 도입 단계가 전체 병합된 PR 중 얼마나 기여했는지 비중 계산이 가능해져 단계별 절대 처리량 비교가 쉬워짐
  • GitHub는 사용자가 AI 도입 단계를 거치며 PR 처리량이 어떻게 바뀌는지 추적하는 데 유용하다고 설명함
  • 해당 지표는 Copilot usage metrics를 REST API로 조회할 수 있는 엔터프라이즈 관리자와 조직 소유자에게 제공됨
  • total_pull_requests_merged는 기존 avg_pull_requests_merged와 동일한 attribution 기준을 사용해 두 지표 간 일관성을 유지함

원문: github.blog


조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.

#GitHub #NVIDIA

조코레터 구독하기

Read more

암호화 AI 컴파일러와 CDN 보안 업데이트 #110

오늘의 레터 1. Google, 동형 암호화 AI 컴파일러 HEIR 공개 2. Vercel CDN, Encrypted Client Hello 지원 Google, 동형 암호화 AI 컴파일러 HEIR 공개 * Google이 Private Computing Toolkit에 오픈소스 동형 암호화 컴파일러 HEIR를 추가 * HEIR는 비암호화 입력을 처리하던 사전 학습 AI 모델을 암호화 입력 기반 추론 모델로 변환 * 동형 암호화는

By TaeyoungPark

AI 생성물 출처 표기와 시스템 개발 도구 공개 #107

오늘의 레터 1. Anthropic, Claude 생성 텍스트 워터마크 적용 2. Modular, Mojo 프로그래밍 언어 1.0 공개 Anthropic, Claude 생성 텍스트 워터마크 적용 * Anthropic이 Claude를 포함한 AI 모델 생성 텍스트에 워터마크를 적용한다고 지원 페이지에서 밝힘 * 2026년 8월 2일 이후 출시된 모델은 생성 텍스트와 파일에 워터마크 기술을 자동 적용 * 파일 워터마크에는

By TaeyoungPark