AI 에이전트 성능 검증과 개발 도구 업데이트 #115
오늘의 레터
NVIDIA, AVO로 ARC-AGI-3 100% 달성

- NVIDIA의 범용 에이전트 시스템 Agentic Variation Operators(AVO)가 ARC-AGI-3 공개 세트에서 RHAE 100.00점을 기록하고 25개 환경의 183개 레벨을 모두 완료
- AVO는 코드와 문서를 확인하고 파일을 수정하며 명령 실행과 결과 검증을 반복하는 장기 작업용 코딩 에이전트
- GPU 커널 최적화에서 7일간 500개 이상의 방향을 탐색하고 40개 커널 버전을 커밋
- NVIDIA DGX B200에서 생성한 멀티헤드 어텐션 커널이 cuDNN 대비 최대 3.5%, FlashAttention-4 대비 최대 10.5% 높은 성능을 기록
- 영속 메모리가 구현·평가 결과·컴파일러·프로파일러 출력과 추론 내용을 다음 작업으로 전달
- 감독 에이전트가 정체와 반복 실패를 감시하고 탐색 전략 변경을 지시해 장기 작업의 진행을 유지
Hugging Face, 음성인식 벤치마크 최적화 측정법 공개

- Hugging Face와 HumeAI 연구진이 음성인식 모델의 벤치마크 최적화 현상을 측정하는 세 가지 검사를 제시
- 11개 오픈소스 ASR 모델을 평가한 결과, 일부 모델이 음성과 다른 벤치마크 기준 전사문을 반복 생성
- VoxPopuli와 LibriSpeech의 기준 전사문에 포함된 패턴과 음향 단서를 모델이 학습한 사례를 확인
- VoxPopuli 분석 대상 클립의 40%에서 기준 전사문 오류 가능성을 식별했으며 전체 기준 단어의 약 3%에 해당
- 벤치마크 최적화 행동을 보인 모델은 합의 기반 수정문보다 잘못된 기준 전사문을 18~30% 비율로 재현
- 새로 수집한 화자와 일반 음성으로 같은 문장을 재합성하면 일부 모델의 오류 재현이 약화되거나 사라짐
- 공개 벤치마크 점수만으로 실제 음성 전사 성능과 신뢰성을 판단하기 어렵다는 평가
원문: huggingface.co
참고: unite.ai · gigazine.net
조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.
#HuggingFace #NVIDIA