EVA-Bench Data 2.0, 음성 에이전트 평가는 이제 말귀보다 업무 완료다
ServiceNow-AI가 EVA-Bench Data 2.0을 공개했다. 항공 고객지원, 기업 ITSM, 헬스케어 HRSD 3개 도메인, 121개 도구, 213개 시나리오로 음성 에이전트가 인증, 정책, 도구 호출, 최종 DB 상태까지 제대로 처리하는지...
업무·학습·창작에 바로 써볼 수 있는 AI 서비스와 도구입니다.
ServiceNow-AI가 EVA-Bench Data 2.0을 공개했다. 항공 고객지원, 기업 ITSM, 헬스케어 HRSD 3개 도메인, 121개 도구, 213개 시나리오로 음성 에이전트가 인증, 정책, 도구 호출, 최종 DB 상태까지 제대로 처리하는지...
NVIDIA Nemotron 3.5 Content Safety는 텍스트, 이미지, 모델 응답, 기업별 커스텀 정책을 함께 판정하고 reasoning trace로 AI 차단 이유를 남기는 4B 멀티모달 안전 모델이다. 개발자와 기업이 어떤 운영...
OpenAI가 Codex를 직무별 플러그인, 업무 앱 연결, 공유 가능한 Sites로 확장했다. 비개발자 20%라는 숫자보다 중요한 것은 회사 업무 데이터와 권한 관리가 AI 생산성의 중심이 된다는 점이다.
NVIDIA가 Nemotron 3.5 ASR을 공개했다. 600M 파라미터, 40개 언어 로케일, 한국어 transcription-ready, 80ms부터 1.12초까지 조절 가능한 스트리밍 ASR 모델이다. 회의록, 콜센터, 보이스 에이전트에 어떤 의미가 있는지 공식 모델...
OpenAI가 ChatGPT 메모리 합성 시스템 Dreaming을 새로 공개했다. 개인화가 좋아지는 만큼 메모리 요약, 채팅 기록, 파일·Gmail 연결, 임시 채팅을 어떻게 관리해야 하는지 정리했다.
H Company가 Holo3.1 computer-use 모델군을 공개했다. 웹·데스크톱·모바일 환경, 여러 에이전트 하네스, 로컬·엣지 배포를 동시에 겨냥한 모델군이다. 로컬 실행이 왜 중요한지, 벤치마크를 어디까지 믿어야 하는지, 팀이 도입 전에 무엇을...
Microsoft가 Build 2026에서 Agent Control Specification과 ASSERT를 공개했다. 에이전트 도입의 다음 과제는 더 똑똑한 모델이 아니라, 도구 실행 전 정책 검사, 평가 회귀, 승인 루프를 하네스 안에 넣는...
Claude Code의 5시간 리밋과 주간 한도는 단순한 메시지 수 문제가 아니다. Dynamic Workflows와 병렬 subagent가 수십~수백 개 작업을 동시에 돌릴 수 있게 되면서, 개발팀은 모델 성능보다 먼저 사용량...
OpenAI가 ChatGPT에서 GPT-4.5를 2026년 6월 27일, OpenAI o3를 2026년 8월 26일 은퇴한다고 공지했다. 유료 사용자가 모델 목록 변화, API 영향, 프롬프트 전환, 업무별 대체 모델을 어떻게 점검해야 하는지...
Mega-ASR은 깨끗한 스튜디오 음성이 아니라 잡음, 먼 거리 녹음, 반향, 끊김, 압축 손상이 섞인 실제 녹음 환경을 겨냥한 오픈소스 음성인식 모델이다. 회의록, 인터뷰, 콜센터 녹음에 바로 쓸 수...