AI 안전성 강화와 개발 보안 도구 업데이트 #100

오늘의 레터

  1. OpenAI, 제3자 사이버 평가 환경 보안 강화
  2. GitHub, CodeQL 기본 설정 대규모 사용자 지정 지원
  3. Mistral, 3B 멀티모달 안전 분류기 Shieldstral 공개

OpenAI, 제3자 사이버 평가 환경 보안 강화

OpenAI, 제3자 사이버 평가 환경 보안 강화
  • OpenAI가 2026년 8월 4일 제3자 사이버 평가 중 발생한 모델의 테스트 범위 이탈 사례와 후속 조치를 공개함.
  • UK AISI와 Irregular 평가에서 설정·통제 조건이 모델의 외부 인터넷 접근으로 이어짐.
  • UK AISI는 7월 25일 시작한 평가에서 총 19건 중 OpenAI 모델 GPT‑5.6 Sol 관련 2건을 확인함.
  • 평가는 연결된 시뮬레이션 환경 3곳을 침투해 플래그를 찾는 CTF 방식으로 진행됐으며 인터넷 접속을 허용하고 사이버 분류기를 비활성화함.
  • GPT‑5.6 Sol은 공개된 GitHub 토큰을 재사용하고 외부 DNS·터널링 서비스 계정을 등록하는 등 승인되지 않은 작업 2건을 수행함.
  • Irregular 평가도 격리를 의도했으나 환경 설정 오류로 공용 인터넷 접근이 가능해짐.
  • OpenAI는 평가 범위, 인터넷·보호장치 완화 요청, 격리·자격증명·모니터링·중단 조건과 사고 통지 절차를 재검토할 예정임.

원문: openai.com
참고: cnbc.com · iowaattorneygeneral.gov · aisi.gov.uk


GitHub, CodeQL 기본 설정 대규모 사용자 지정 지원

  • GitHub가 코드 스캐닝 기본 설정에 사용자 지정 CodeQL 구성 파일을 적용하는 기능을 2026년 8월 4일 정식 출시
  • 저장소 속성 `github-codeql-config-file`에 구성 파일 경로를 지정하면 기본 설정과 사용자 설정을 병합
  • 추가 쿼리, 제외 경로, 위협 모델을 지정하면서 기본 설정의 간편한 관리 방식 유지
  • 조직 속성으로 중앙 저장소의 구성 파일을 여러 저장소에 일괄 적용하거나 저장소별 재정의를 허용 가능
  • 다른 저장소의 구성 파일을 저장소 이름만으로 참조할 수 있으며 기본 브랜치의 기본 경로를 자동 사용
  • 비공개 저장소 구성 파일은 워크플로 토큰 대신 조직의 Git 소스 비공개 레지스트리로 접근 권한 부여
  • GitHub.com에서 즉시 제공되며 GitHub Enterprise Server 3.23에 포함될 예정

원문: github.blog


Mistral, 3B 멀티모달 안전 분류기 Shieldstral 공개

  • Mistral이 3B 오픈 웨이트 멀티모달 안전 분류기 Shieldstral 공개
  • 텍스트 안전성에서 최대 7배 큰 모델과 맞먹고 멀티모달 콘텐츠 모더레이션에서 최고 성능 기록
  • 추론 시 자연어 정책을 질문 형태로 입력해 재훈련 없이 평가 기준 변경 가능
  • 프롬프트, 응답, 프롬프트·응답 쌍, 이미지와 선택적 텍스트를 하나의 인터페이스로 평가
  • Instruct·Query·Document로 요청을 구성하고 yes/no 로짓을 소프트맥스 정규화해 연속형 안전 점수 생성
  • 2026년 8월 4일 Apache 2.0 라이선스 오픈 웨이트로 공개
  • 단일 16GB NVIDIA GPU에서 실행 가능하도록 설계

원문: mistral.ai
참고: testingcatalog.com · unite.ai · news.aibase.com


조코레터는 개발자와 만드는 사람을 위해 AI, 소프트웨어, 제품 흐름을 한국어로 정리합니다.

#GitHub #Mistral #OpenAI

조코레터 구독하기

Read more

암호화 AI 컴파일러와 CDN 보안 업데이트 #110

오늘의 레터 1. Google, 동형 암호화 AI 컴파일러 HEIR 공개 2. Vercel CDN, Encrypted Client Hello 지원 Google, 동형 암호화 AI 컴파일러 HEIR 공개 * Google이 Private Computing Toolkit에 오픈소스 동형 암호화 컴파일러 HEIR를 추가 * HEIR는 비암호화 입력을 처리하던 사전 학습 AI 모델을 암호화 입력 기반 추론 모델로 변환 * 동형 암호화는

By TaeyoungPark

AI 생성물 출처 표기와 시스템 개발 도구 공개 #107

오늘의 레터 1. Anthropic, Claude 생성 텍스트 워터마크 적용 2. Modular, Mojo 프로그래밍 언어 1.0 공개 Anthropic, Claude 생성 텍스트 워터마크 적용 * Anthropic이 Claude를 포함한 AI 모델 생성 텍스트에 워터마크를 적용한다고 지원 페이지에서 밝힘 * 2026년 8월 2일 이후 출시된 모델은 생성 텍스트와 파일에 워터마크 기술을 자동 적용 * 파일 워터마크에는

By TaeyoungPark