연구소르테크
AI Agent가 도구를 실행하기 직전, 우리는 무엇을 통제했나
AI 에이전트가 답변만 생성할 때와 실제 업무 도구를 사용할 때의 위험은 다르다. 메일을 읽는 것과 보내는 것, 항공편을 조회하는 것과 예약을 취소하는 것, 계좌 정보를 확인하는 것과 송금하는 것은 모두 ‘도구 사용’이지만 결과의 무게는 전혀 다르다. 어떤 행동은 되돌릴 수 있고, 어떤…
AI 에이전트가 답변만 생성할 때와 실제 업무 도구를 사용할 때의 위험은 다르다. 메일을 읽는 것과 보내는 것, 항공편을 조회하는 것과 예약을 취소하는 것, 계좌 정보를 확인하는 것과 송금하는 것은 모두 ‘도구 사용’이지만 결과의 무게는 전혀 다르다. 어떤 행동은 되돌릴 수 있고, 어떤…
토큰 단가는 해마다 내려간다. 캐싱은 입력 비용을 약 90%, 배치 처리는 50%를 깎아준다. 그런데 현장의 청구서는 반대로 움직인다. 파일럿은 손익에 잡히는 성과를 내지 못하고, 에이전트 프로젝트는 비용 문제로 취소된다. 단가가 내려가는데 비용 때문에 실패한다면, 문제는 단가가 아니라…
이 글은 WAA(Windows Agent Arena) 리더보드 시리즈의 2번째 글입니다. 필드 전체 순위(원본 WAA / WAA-V2)는 이전 글에 정리돼 있고, 이 글은 그중 우리 실험을 자세히 다룹니다. TL;DR Windows Agent Arena(WAA) 154개 태스크를 처음부…
개요 원본 WAA와 WAA-V2는 태스크와 evaluator가 다르므로 분리해서 봅니다. 같은 표에서 섞어 최고점을 비교하면 안 됩니다. 아래 표는 각 결과를 step budget(15/30/50/100), run type(단일 실행 · best-of-N · pass@N · select…