8월 12일 아침 확인한 AI 이슈는 인프라 투자에서 의료 상담, 기업용 서비스, 에이전트 보안, 공공 평가와 교육까지 넓게 퍼졌다. 아래 8건은 서로 다른 사안이며, 기업 발표와 모의 실험, 사전 공개 논문의 근거 수준을 구분해 읽어야 한다.
1. Riot, 191MW AI 데이터센터 20년 임대 계약
Riot Platforms는 191MW 규모 인프라를 20년 동안 AI 데이터센터 용도로 임대하는 계약을 발표했다. 기본 계약 가치는 91억달러이며, 5년 연장 선택권 두 차례가 모두 행사되면 최대 160억달러까지 늘어날 수 있다.

회사 공식 발표는 고객 이름을 밝히지 않았다. 별도 보도는 고객을 Anthropic으로 연결했으므로, 확정된 계약 조건과 보도상 고객 추정을 구분해야 한다. 암호화폐 채굴 기업이 전력·부지를 AI 인프라로 전환하는 흐름을 보여주는 사례다.
2. Google AMIE, 영상 진료 모의 평가에서 의사와 비교
Google Research는 Gemini와 Project Astra를 바탕으로 한 멀티에이전트 의료 연구 시스템 AMIE의 영상 상담 결과를 공개했다. 1차진료의 30명, 환자 역할 배우 15명, 모의 시나리오 100개를 사용했다.
평가자들은 병력 청취, 진단, 관리, 화면을 통한 신체 관찰에서 AMIE를 의사와 비슷하거나 더 높게 평가했다. 반면 공감과 협력 관계에서는 의사가 더 나았다. 실제 환자 진료가 아닌 모의 환경 연구로, 임상 도입 전 현실 환경의 안전성 검증이 필요하다.
3. ChatGPT Business에 Premium 좌석 추가
OpenAI는 ChatGPT Business 조직이 Standard와 Premium 좌석을 섞어 쓸 수 있게 했다. Premium은 사용량 5배와 5시간 사용 제한 제거, 주간 초기화를 제공하며 가격은 월 125달러 또는 연간 약정 기준 월 100달러다.
Standard는 월 25달러, 연간 약정 기준 월 20달러다. 전 직원에게 같은 등급을 제공하는 대신 고사용량 직무에 비싼 좌석을 배정하는 기업용 가격 차등화가 본격화한 것으로 볼 수 있다.
4. 암호화된 추론 흔적의 재사용이 만든 정보 노출 위험
한 사전 공개 연구는 세션·사용자·모델 사이에서 암호화된 추론 블록을 재사용하는 구조를 조사했다. 저자들은 Anthropic, OpenAI, Google 계열 시스템을 대상으로 공격을 실험하고 공개 추론 블록 31만5,320개에서 개인정보 흔적 367건과 자격증명 182건을 복구했다고 보고했다.
수치는 연구팀의 분석 결과이며 각 서비스 전체의 침해 규모를 뜻하지 않는다. 저자들은 책임 공개를 거쳤다고 밝혔지만, 공급자의 수정 상태와 독립 재현 여부를 함께 확인해야 한다.
5. 여러 AI 스킬이 공모하면 개별 검사가 뚫릴 수 있다
ColluSkill 연구는 각각 따로 보면 정상처럼 보이는 여러 스킬이 함께 작동해 금지된 목표를 수행하는 공격을 제시했다. 연구진은 스캐너 6종에서 평균 공격 성공률 96%를 보고했고, 실행 흐름 전체를 보는 ChainGuard 적용 뒤 22.5%로 낮아졌다고 밝혔다.
정상 스킬 통과율은 99.5%로 보고됐다. 다만 9쪽 사전 공개 논문의 실험 환경 결과이므로, 실제 에이전트 마켓과 다른 공격 조건에서도 효과가 유지되는지 검증이 필요하다.
6. 네덜란드 정부 평가, ‘모든 기준에서 최고인 LLM은 없다’
네덜란드 정부 관련 연구는 30개가 넘는 모델을 사실성, 정직성, 편향, 에너지, 비용, 학습데이터 투명성으로 평가했다. AIES 2026 채택 논문은 모든 기준에서 가장 좋은 단일 모델은 없으며 사실성이 높다고 해서 모르는 것을 솔직히 인정하는 정직성까지 높은 것은 아니라고 지적했다.
공공기관의 모델 선정이 종합 순위 하나로 끝날 수 없다는 뜻이다. 업무 위험도와 예산, 에너지, 투명성에 따라 가중치를 달리하고 실제 사용 조건에서 다시 평가해야 한다.
7. TTS 평가는 발음 오류의 폭을 충분히 잡아내지 못했다
진행 중인 연구는 860개 발화와 10개 오류 차원으로 음성합성 평가 도구를 비교했다. MOS 예측기 4종과 오디오 LLM 심사자 4종 모두 언어적으로 구조화된 오류의 폭을 안정적으로 포착하지 못했다고 보고했다.
자연스럽게 들리는지를 하나의 점수로 압축하면 숫자·고유명사·강세·문장 경계 같은 중요한 실패를 놓칠 수 있다. 교육과 접근성 서비스에서는 전체 만족도와 별도로 오류 유형별 사람 검수가 필요하다.
8. 교육 특화 모델이 교육 평가에서 선두를 차지하지 못했다
ELBench 사전 공개 연구는 범용 프런티어 모델 7종과 교육 특화 모델 2종을 포함한 9개 모델을 평가했다. 전체 점수에서 상위 6개는 통계적으로 구분되지 않았고, 교육 특화 모델도 교육 모듈을 주도하지 못했다.
연구 표본에서는 안전성과 실용적 교수 수행 사이에 r=-0.83의 역상관이 보고됐다. 안전 장치가 교육 품질을 떨어뜨린다는 일반 결론은 아니며, 거절 기준과 실제 도움을 함께 측정하는 평가 설계가 필요하다는 문제 제기에 가깝다.
출처
1. Riot Platforms 공식 발표 · Cinco Días 보도
2. Google Research AMIE 발표 · AMIE 논문
3. OpenAI ChatGPT Business Premium 좌석 발표
4. 암호화 추론 흔적 연구
8. ELBench 교육 모델 평가 · 모든 출처 2026년 8월 12일 확인



