AI 에이전트 운영과 오픈소스 추론 인프라 업데이트 #124
오늘의 레터
vLLM v0.28.0, Kimi-K3·DeepSeek V4 최적화
- 8월 26일 v0.28.0 출시. 584개 커밋에 270명이 참여했으며 신규 기여자는 76명
- Kimi-K3에 DCP, FlashKDA 융합 커널, SiTU, GEMM-RS, 통합 all-gather 최적화 적용
- 커널 수준에서 1.5~3배 속도 향상, DSpark TTFT 약 60% 개선, GPU당 약 17GiB 메모리 절감 지원
- Kimi-K3가 V2 모델 실행기를 통해 ROCm에서도 동작
- DeepSeek V4의 희소 MLA가 일반 디코드·MTP·DSpark 추론 전 과정에서 지원됨
- DFlash2 후보 선택기와 DSpark 검증 스케줄링을 추가하고 초안 모델 비동기 스케줄링을 기본 활성화
- V2 모델 실행기에 E/P/D 분산, 가중치 오프로딩, 다중 계층 MTP KV 캐시, 인코더 CUDA 그래프 추가
- 최대 배치 토큰 기본값을 8192에서 16384로 변경하고 Transformers 5.15.0 적용, bitsandbytes 지원은 외부 플러그인으로 이동
원문: github.com
Warp, Claude 기반 자기개선 에이전트 구축

- Warp는 Claude Platform 위에 AI 터미널과 에이전트 개발환경을 구축함
- 내부 코드 리뷰 에이전트에서 부적절한 코멘트와 낮은 품질 출력 문제가 발생함
- 세션 종료 뒤 사용자 피드백이 사라져 에이전트 개선에 누적되지 않는 점을 핵심 문제로 확인함
- Agent Skills에 지식과 지침을 파일 형태로 저장하고 피드백을 다음 작업에 반영하는 자기개선 루프를 설계함
- 기술 스택은 Rust, Golang, GitHub Actions, 내부 오케스트레이션 플랫폼 Oz, Claude Platform으로 구성됨
- Warp는 2020년 설립됐으며 7,300만 달러를 조달했고 월간 개발자 80만 명이 사용한다고 밝힘
원문: claude.com
참고: youtube.com
Sponsored · 조코헌트 · 만약사주 (자동)
🏆 조코헌트 TOP1 · 과거의 선택을 다시 짚어보는 가정형 사주 앱

과거의 특정 순간을 기준으로, 그때 다른 선택을 했다면 이후 흐름이 어떻게 달라졌을지 사주 형식으로 풀어보는 앱입니다.
미래를 점치는 대신 후회되는 선택의 갈림길을 다시 비춰주고, 놓친 순간도 다른 가능성으로 상상하게 돕는 것이 이 제품의 핵심입니다.
“가장 후회되는 그 순간으로 돌아간다면 언제일지 궁금하네요”
조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.
#Warp #vLLM