
타일러 벨, 제품 담당 수석 부사장
다음은 흔히 겪는 상황입니다. 볼 수 있는 TV 콘텐츠가 너무 많아서, 끝없이 스크롤을 내리는 수고를 덜기 위해 친구나 가족에게 추천할 만한 프로그램을 물어보게 됩니다. 다행히도, 여러분이 《옐로스톤》, 《랜드맨》, 《킹스타운의 시장》을 즐겨 봤다는 사실을 알고 있는 친구가 테일러 셰리던의 최신 TV 시리즈 《 더 매디슨》을 추천해 줍니다.
드라마를 빨리 보고 싶은 마음에, 음성 인식 리모컨에게 첫 번째 에피소드를 찾아 재생해 달라고 요청합니다. 하지만 뉴욕에서 몬태나의 황야로 이사 온 한 가족의 이야기를 다룬 미셸 파이퍼 주연의 드라마 대신, 위스콘신주 매디슨에 사는 젊은이들을 다룬 리얼리티 TV 프로그램이 재생됩니다.
테일러 셰리던과 그가 구축한 인기 TV 드라마 제국을 둘러싼 열기를 고려하면, 이 말은 믿기 어려워 보일 수도 있습니다. 하지만 우리가 셰리던의 TV 세계관에서 방영 중인 최신 프로그램에 대한 정보를 요청했을 때, 훈련 데이터가 부족한 LLM이 내놓은 답변이 바로 이랬습니다.

이 반응이 놀랍게 보일지 모르겠지만, 사실 놀랄 일은 아닙니다. 그 이유는 LLM에는 몇 가지 매우 기본적인 한계가 있기 때문입니다.
LLM은 추론과 논리적 사고에 탁월하지만, 사실을 명확하게 표현하도록 설계된 것은 아닙니다. 예측 엔진으로서 LLM의 유일한 기능은 다음 토큰을 예측하는 것입니다. 그리고 위의 예에서 볼 수 있듯이, LLM의 지식 범위가 제한되어 있어 훈련 기간이 끝난 후 발생한 일, 예를 들어 2026년 3월 《더 매디슨》의 첫 방송과 같은 사건에 대해서는 알 수 없습니다.
LLM의 경우, 응답 정확도는 사실이 아니라 최적화된 타당성에 전적으로 좌우됩니다. 데이터와 훈련을 통해 결과를 개선할 수는 있지만, 확률에 기반해 응답하도록 훈련된 기계로부터 사실적 정확성을 기대해서는 안 됩니다. ChatGPT나 Gemini와 같은 인기 있는 챗봇과 마찬가지로, 어떤 동영상 배포 서비스에 탑재된 LLM이든 제공되는 응답을 검증하고, 수정하며, 개선하기 위해서는‘그라운딩(grounding)¹’이 필요합니다.
그러나 인기 있는 챗봇들과는 달리, 콘텐츠 검색 및 발견에 사용되는 대규모 언어 모델(LLM)은 해당 분야에 특화된 근거 기반 훈련이 필요합니다. 예를 들어, 신뢰할 수 있는 엔터테인먼트 데이터로 근거 기반 훈련을 실시하면, 근거가 부족한 LLM이 2025년 개봉 예정인 ‘Heel’이라는 매우 유사한 제목의 장편 영화에 대해 질문을 받았을 때, 2021년부터 2023년까지 방영된 Starz TV 시리즈 ‘Heels’에 대한 정보를 반환하는 것을 방지할 수 있습니다.

콘텐츠 카탈로그가 늘어나면서 콘텐츠를 찾는 데 어려움이 커지고 있는데, TV 시청자들은 이제볼 만한 프로그램을 찾느라 14분을 소비한다고 밝히고 있습니다². LLM은 시청자들의 콘텐츠 탐색 문제를 해결할 수 있는 능력을 갖추고 있지만, 이를 혼자서 해낼 수는 없습니다.
훈련 데이터에만 의존하는 대규모 언어 모델(LLM)은 포괄적인 지식 저장소가 아닙니다. 이러한 근본적인 특성은 LLM이 제공하는 답변이 최신이고 정확하도록 보장하기 위해 외부 데이터가 필요한 핵심적인 이유입니다. 예를 들어, 외부 데이터에 기반하지 않을 경우, 지식의 한계로 인해 LLM은 배포된 이후에 공개된 어떤 콘텐츠도 인식하지 못하게 되는데, 매년 얼마나 많은 새로운 TV 프로그램과 영화가 개봉되는지를 고려할 때 이는 주목할 만한 한계입니다.

관객들에게는 답답한 일이겠지만, 신작 영화에 대해 질문 받았을 때 대규모 언어 모델(LLM)이 보일 수 있는 최선의 반응은 단순히 훈련 데이터의 한계를 인정하는 것일 수 있다. 최근 ‘ Gracenote ’ 연구에 따르면, 2025년 5월에 출시된 훈련 데이터가 부족한 LLM은 2025년과 2026년에 개봉한 다양한 최신 주류 영화에 대한 정보가 없다고 밝히며 바로 그런 반응을 보였다.

그러나 더 흔한 경우는, LLM이 자신이 알지 못하는 내용을 지어내기도 하며(즉, “환각”을 일으키기도 하며), 이를 매우 확신에 찬 태도로 내놓는다는 점이다. 이는 엔터테인먼트 업계에서, 특히 시장의 파편화가 심화되고 전작과 동일한 제목을 가진 리부트 작품이 넘쳐나는 상황에서 사용자 경험에 상당한 위험을 초래한다.
환각 현상이 콘텐츠 발견에 미치는 영향을 더 잘 이해하기 위해, 최근 수행된 본 연구에서는 13개국의 상위 100개 TV 에피소드와 상위 100개 영화에 대해, 근거가 없는 대규모 언어 모델(LLM)이 얼마나 많은 정보를 허위로 생성했는지 평가했다. 총 2,600개의 작품 중, 근거가 없는 LLM은 506개 작품(전체 작품의 약 20%)에 대한 속성 수준 정보를 100% 허위로 생성했다.

한정된 훈련 데이터, 다음 토큰 예측, 그리고 근거 데이터의 부족과 관련된 인프라적 한계들이 복합적으로 작용하여 TV 시청자들에게 불만족스러운 경험을 안겨줍니다. 결국, 긍정적인 사용자 경험은 시청자가 원하는 내용을 찾을 수 있느냐에 달려 있습니다. 이 점에서, 근거가 없는 대규모 언어 모델(LLM)은 사실적 정확성을 보장할 수 없다는 이유만으로도 이 과제를 수행하기에 역부족입니다.
스트리밍 서비스의 경우, 근거 없는 AI는 단순한 이론상의 문제가 아닙니다. 만약 AI 어시스턴트가 줄거리를 지어내거나, 잘못된 출연진을 제시하거나, 비슷한 제목의 작품들을 혼동한다면, 시청자들은 모델 자체를 탓하지 않을 것입니다. 대신 시청자들은 그 경험 자체를 탓할 것이며, 따라서 ‘근거성’은 신뢰, 이용자 유지 및 수익 창출에 있어 필수적인 요소가 됩니다.
바로 이러한 위험 때문에 콘텐츠 발견 문제를 해결하는 것이 그토록 시급한 것이며, 현재 시청자들이 직면한 가장 큰 과제는 볼 만한 콘텐츠를 찾는 것입니다. 대규모 언어 모델(LLM)이 이 과정에서 결정적인 역할을 할 것이지만, 성공적인 AI 전략은 단순히 더 큰 모델을 도입하는 것만으로는 구축될 수 없습니다.
대신, 선도적인 미디어 기업과 스트리밍 서비스 제공업체들은 라이선스가 부여된 데이터 세트, MCP 서버 또는 신뢰할 수 있는 지식 그래프와의 기타 연결을 통해 제공되는, 완전하고 최신의 콘텐츠 인텔리전스를 자사의 AI 스택 내에 직접 구축할 것입니다.
AI 분야에서 매우 중요한 차이점이 하나 있습니다. 소비자인 여러분이 ChatGPT, Gemini 또는 Claude와 상호작용할 때, 여러분이 경험하는 것은 각각 OpenAI, Google 또는 Anthropic으로부터 전문적으로 라이선스를 취득하여 사용하는 모델이 아닙니다. 대신, 여러분은 수많은 보조 도구와 데이터가 결합된 기본 모델의 구현체인 ‘에이전트’와 상호작용하고 있는 것입니다.
수학 문제가 있으신가요? 이 모델은 해당 질문을 산술 도구로 전달합니다. 최근 사건, 스포츠 경기 결과 또는 최신 뉴스에 대해 알고 싶으신가요? 이 모델은 해당 질문을 웹을 검색하는 전용 도구로 넘깁니다. 이러한 소비자 대상 챗봇은 수십 개, 심지어 수백 개에 달하는 분야별 및 작업별 도구와 데이터 소스를 활용하여 소비자에게 정확한 정보를 제공하는 경험을 선사합니다.
엔터테인먼트 스택에 LLM을 도입할 때, 일반 소비자용 챗봇과 동일한 도구나 데이터를 사용할 수는 없습니다. LLM은 불완전한 솔루션입니다. 따라서 다음을 수행하기 위해 자체적으로 데이터와 도구를 확보해야 합니다:
MCP 서버와 같은 특정 도구는 에이전트 내에서 행동 지침(시스템 프롬프트) 및 비즈니스 로직과 결합됩니다. 엔터테인먼트 스택 내의 각 AI 관련 작업마다 서로 다른 에이전트를 구현하게 될 가능성이 높지만, 이들 모두 동일한 LLM과 대체로 동일한 도구 세트를 사용할 것입니다.
이 기사는 원래 Streaming Media에 게재되었습니다.
LLM은 콘텐츠 검색과 관련해 점점 커져가는 불만을 해소할 수 있는 잠재력을 지니고 있지만, 제대로 된 결과를 내놓지 못한다면 소용이 없다.
양식을 채워서 문의하세요!
귀하의 문의가 접수되었으며 최선을 다해 도와드리겠습니다. 즉시 메시지를 검토하여 가능한 한 빨리 답변해 드리겠습니다.