AI 추론 성능과 개발 도구 지표 업데이트 #61
오늘의 레터
NVIDIA, Blackwell용 DFlash 추론 가속 공개

- NVIDIA가 Blackwell GPU용 speculative decoding 모델 DFlash를 공개하고, LLM 추론 처리량을 최대 15배 높일 수 있다고 소개함
- DFlash는 경량 drafter가 토큰을 순차 생성하는 대신 후보 토큰 블록 전체를 한 번에 만들고, target 모델이 이를 병렬 검증하는 구조임
- 8개 NVIDIA DGX B300 기반 TensorRT-LLM 구성에서 gpt-oss-120b는 사용자당 500~600 tokens/sec 구간에서 autoregressive decoding 대비 15배 이상 높은 처리량을 기록함
- 같은 조건에서 EAGLE-3 speculative decoding 대비 처리량은 1.5배 높았고, batch size 1의 최저 동시성 구간에서는 interactivity가 2배 이상 개선됐다고 설명함
- NVIDIA는 Llama 3.1 8B 기준으로도 같은 동시성에서 EAGLE-3 대비 interactivity가 거의 2배 수준으로 개선됐다고 밝힘
- 연구팀은 Hugging Face에 DFlash 체크포인트 20종을 공개했고, NVIDIA Blackwell·Hopper용 레시피도 함께 제공함
- NVIDIA는 DFlash가 SGLang, vLLM, TensorRT-LLM 등 주요 추론 스택에 확장되고 있어 기존 개발 워크플로에 큰 코드 수정 없이 적용할 수 있다고 설명함
- 관련 논문은 2026년 2월 공개됐고, 이번 글은 2026년 6월 23일 NVIDIA Technical Blog에 게시됨
GitHub, Copilot 도입 단계별 PR 병합 총계 추가

- GitHub가 2026년 6월 26일 Changelog에서 조직·엔터프라이즈 리포트에 AI 도입 단계별 pull request 병합 총계를 추가함
- 기존 totals_by_ai_adoption_phase 항목은 사용자당 평균값만 제공했지만, 이제 일자별 total_pull_requests_merged 값을 함께 제공함
- 새 지표는 기존 avg_pull_requests_merged를 보완하는 항목으로, 1일 리포트와 28일 리포트에서 모두 확인 가능함
- 각 도입 단계가 전체 병합된 PR 중 얼마나 기여했는지 비중 계산이 가능해져 단계별 절대 처리량 비교가 쉬워짐
- GitHub는 사용자가 AI 도입 단계를 거치며 PR 처리량이 어떻게 바뀌는지 추적하는 데 유용하다고 설명함
- 해당 지표는 Copilot usage metrics를 REST API로 조회할 수 있는 엔터프라이즈 관리자와 조직 소유자에게 제공됨
- total_pull_requests_merged는 기존 avg_pull_requests_merged와 동일한 attribution 기준을 사용해 두 지표 간 일관성을 유지함
원문: github.blog
조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.
#GitHub #NVIDIA