스마트폰 음성 비서에게 긴 문서 요약과 일정 조율을 동시에 맡길 때 답변이 늦어지면 사용자는 곧바로 서비스 지연을 체감합니다. 복잡한 명령을 단계별로 처리하는 자율형 인공지능 에이전트가 늘어나면서 데이터센터에서는 방대한 문맥을 순식간에 계산해 내는 빠른 응답 속도가 핵심 경쟁력으로 떠올랐습니다. 엔비디아는 미국 캘리포니아주 팰로앨토에서 열린 핫칩스 콘퍼런스를 통해 에이전트 인공지능 추론에 특화된 랙 스케일 시스템인 베라 루빈과 그록 3 LPX의 전면 양산 소식을 공개했습니다. 이번 발표는 인공지능 시장의 중심축이 대규모 모델 학습에서 실시간 연산과 응답을 담당하는 추론 단계로 옮겨가고 있음을 보여줍니다. 초당 3400개 토큰 생성으로 확인한 추론 가속 성능 엔비디아가 제시한 아티피셜 아날리시스의 벤치마..