앤트로픽이 새롭게 선보인 Claude Fable 5.1은 단일 질의응답을 넘어 장기 작업을 독립적으로 수행하는 에이전트 환경에 맞춤 설계되었다. 개발자는 이제 계획 수립부터 실행, 오류 복구, 검증에 이르는 복잡한 워크플로우를 더욱 안정적으로 구축할 수 있다. 하지만 이전 모델인 Fable 5와 비교했을 때 추론량 설정, 도구 호출 방식, 진행 상황 보고 시스템 등에서 세부적인 변화가 생겼으므로, 실무에 적용하기 전에 최적화 전략을 면밀히 검토해야 한다.

Claude Fable 5.1 출시와 주요 변화

Claude Fable 5.1은 장기 작업 도중에 발생하는 계획 수립, 실행, 복구, 검증 프로세스를 에이전트가 지속적으로 수행할 수 있도록 설계된 모델이다. 이 모델은 대규모 데이터를 처리할 수 있도록 1M 토큰의 방대한 콘텍스트 윈도우와 최대 128K 토큰 출력을 지원하는 강력한 스펙을 갖추었다. 이를 통해 개발자는 단일 프롬프트 한계를 넘어 복잡하고 긴 호흡의 비즈니스 로직을 에이전트에게 안정적으로 위임할 수 있다.

비용 측면에서도 실무 개발자에게 유리한 변화가 적용되었다. 입력 토큰당 10달러/M, 출력 토큰당 50달러/M의 가격은 기존 Fable 5와 동일하게 유지되는 반면, 캐시 읽기 비용은 1M 토큰당 기존 1달러에서 0.25달러로 75% 인하되었다. 이처럼 대폭 줄어든 캐시 비용 덕분에 반복적인 에이전트 호출 환경에서 발생하는 누적 비용 부담을 크게 덜 수 있다.

Claude Fable 5.1은 단일 질의응답을 넘어 계획과 검증을 지속하는 장기 작업형 에이전트 환경에 최적화되었다.

Effort 설정 재검토와 비용 영향

Fable 5.1에서 제공하는 low, medium, high, xhigh, max 등의 effort 설정은 모델의 실제 추론 방식과 깊이가 변했기 때문에 기존 Fable 5 기준의 설정을 그대로 적용해서는 안 된다. 두 버전 사이에 동일한 이름을 가진 effort 레벨이 존재하더라도, 정량적인 실제 추론량이 물리적으로 어떻게 차이가 나는지는 정확히 확인되지 않았다. 다만 지연 시간과 답변의 구조적 상세함 등 행동 양식의 변화를 통해 추론 방식이 변경되었음을 명확히 인지할 수 있다.

실제로 medium 설정을 적용하면 Fable 5급 품질의 답변을 더 적은 비용으로 얻을 수 있는 반면, max 설정은 비용 상승을 야기한다. max effort 설정 시 Fable 5.1은 Fable 5 대비 태스크당 약 1.7배 더 많은 출력 토큰을 사용하며, 이로 인해 약 20% 더 높은 비용이 발생한다는 점을 고려해야 한다. 참고로 기본 설정의 경우 코딩 도구인 Claude Code에서는 High로 작동하며, Claude Cowork 및 Claude.ai 환경에서는 Medium으로 기본 적용된다.

Fable 5.1의 effort 레벨은 기존 5 버전과 실제 추론량이 다르므로 서비스 적용 시 동일 레벨이라도 재평가가 필요하다.

긴 에이전트 루프의 진행 상황 수신 설정

장기적인 도구 호출 작업을 수행할 때 Fable 5.1은 중간 과정에서 사용자에게 노출되는 업데이트를 최소화하여 작성하는 것을 기본 동작으로 삼는다. 이로 인해 에이전트가 내부적으로 바쁘게 동작하는 동안 겉으로는 몇 분 동안 아무런 반응이 없거나, 작업이 완료된 후 최종 보고서에 전체 과정이 아닌 마지막 단계의 내용만 표시되는 현상이 발생할 수 있다. 개발자 입장에서는 프로세스가 중단된 것인지 정상 작동 중인지 파악하기 어려워진다.

이 문제를 해결하려면 진행 상황을 텍스트 형태로 실시간 수신할 수 있도록 설정해야 한다. Fable 5.1은 기본적으로 thinking.display 설정이 "omitted"로 지정되어 있어 도구 호출 사이의 메모인 'progress-update thinking blocks'가 비어 있는 상태로 전달된다. 진행 상황을 수신하려면 API 요청 시 thinking-display-updates-2026-08-18 베타 헤더를 전송하고 thinking.display 설정을 "updates"로 지정하면 중간 진행 상황 메모를 텍스트로 받아볼 수 있다.

긴 도구 호출 작업 중 중간 업데이트가 누락되지 않도록 베타 헤더 설정을 통해 텍스트로 진행 상황을 수신해야 한다.

순차 도구 호출 방지와 프롬프트 최적화

Fable 5.1은 여러 독립적인 요청이 주어지면 기본적으로 도구를 병렬로 호출하여 처리한다. 하지만 복잡한 에이전트 루프나 컴퓨터 사용 환경처럼 다음 단계의 독립적인 호출이 암시적으로 연계되는 상황에서는 모델이 도구를 한 번에 하나씩 순차적으로 호출하는 현상이 발생하기도 한다. 이러한 순차적 호출은 최종 답변의 품질을 떨어뜨리지는 않지만, 불필요한 API 호출 턴을 늘려 비용과 실행 시간을 낭비하게 만든다.

이 같은 순차 호출 문제를 방지하고 병렬 처리를 유도하려면 프롬프트 최적화가 필수적이다. 각 도구 결과 세트 다음에 배치되는 턴 스코프 시스템 메시지에 "First privately list what you need next; then request every item that does not depend on another result in a single response"와 같은 명확한 지시 사항을 추가해야 한다. 이 프롬프트는 의존성이 없는 요청들을 단일 응답 내에서 한 번에 병렬 요청하도록 강제함으로써 호출 효율성을 극대화한다.

복잡한 작업 환경에서 무분별한 순차 도구 호출을 줄이려면 턴 스코프 시스템 메시지로 병렬 요청을 유도해야 한다.

Claude Fable 5.1 최적 활용 요약

Claude Fable 5.1을 성공적으로 도입하기 위해서는 변화된 모델 특성에 맞추어 개발 환경을 선제적으로 재정비해야 한다. 기존 Fable 5에서 사용하던 effort 설정을 무조건 대입하기보다 실제 요구되는 추론 깊이에 맞춰 비용과 성능의 균형점을 재측정하고 조정하는 작업이 우선되어야 한다. 특히 고비용이 발생하는 max 설정을 무분별하게 사용하는 것을 지양하고 서비스 목적에 맞는 적절한 레벨을 찾아야 한다.

또한 장기 작업의 투명한 모니터링을 위해 API 호출 시 베타 헤더를 적용하고 thinking.display 설정을 업데이트 수신 모드로 전환하는 구조적 보완이 필요하다. 다행히 Fable 5.1은 사이버 보안 및 생물학 분야의 안전장치가 강화되었음에도 불구하고 이전 대비 세션당 안전장치 개입이 약 60% 감소하여 개발자에게 더 매끄러운 에이전트 제어 환경을 제공하므로, 적극적인 프롬프트 개선을 통해 최적화된 에이전트 시스템을 구축해야 한다.


참고