Jay's <Devlog />Jay's Devlog
HomeBlogAbout
Login

© 2026 Jay's <Devlog />. All Rights Reserved.

GitHubLinkedIn
Gravatar
  1. Home
  2. Blog
  3. AI
  4. ISRF 논문 정리: LLM 추천 시스템에서 개인 관심사와 그룹 잠재 관심사를 함께 추론하는 방법
JAY'S DEV
AI 77 min read

ISRF 논문 정리: LLM 추천 시스템에서 개인 관심사와 그룹 잠재 관심사를 함께 추론하는 방법

jay

jay

2026년 9월 10일 23:35

이번 글에서는 WWW 2026에 발표된 “Iterative Semantic Reasoning from Individual to Group Interests for Generative Recommendation with LLMs” 논문을 정리한다.

이 논문에서 제안하는 모델의 이름은 ISRF(Iterative Semantic Reasoning Framework)다. 핵심 아이디어를 먼저 한 문장으로 정리하면 다음과 같다.

사용자가 직접 보여준 행동만으로 관심사를 모델링하는 데서 그치지 않고, 상품의 의미를 추론한 뒤 의미적으로 비슷한 사용자 집단의 행동까지 이용해 아직 드러나지 않은 관심사를 추론한다.

이를 위해 논문은 크게 Individual Interest Reasoning(IIR), Group Interest Reasoning(GIR), Iterative Refinement(IR)의 세 모듈을 사용한다.

먼저 알아야 할 추천 시스템의 기본 개념

이 논문은 LLM, GNN, Contrastive Learning 등 여러 개념을 한꺼번에 사용한다. 하지만 가장 먼저 이해해야 하는 것은 추천 시스템이 기본적으로 무엇을 학습하려는지다.

User-Item Interaction

추천 시스템에서 가장 기본적인 데이터는 사용자와 아이템 사이의 상호작용이다. 예를 들어 사용자가 특정 상품을 클릭하거나 구매했다면 하나의 interaction으로 볼 수 있다.

예를 들어 A 사용자가 농구화와 농구공을 구매했다고 하자.

User A → 농구화
User A → 농구공

추천 시스템은 이런 과거 행동을 바탕으로 A 사용자가 다음에 어떤 상품에 관심을 보일지를 예측한다.

Collaborative Filtering

추천 시스템에서 오래 사용된 핵심 아이디어 중 하나가 Collaborative Filtering이다.

직관적으로는 다음과 같다.

나와 비슷한 행동을 한 사람들이 좋아한 상품이라면 나도 좋아할 가능성이 높다.

예를 들어 A와 B가 둘 다 농구화를 구매했고, B가 추가로 기능성 농구 양말을 구매했다면 A에게도 해당 상품을 추천할 수 있다.

ISRF도 결국 이 아이디어를 활용한다. 다만 단순히 같은 Item ID를 클릭했는지를 보는 것이 아니라, LLM이 추론한 의미적 관심사가 비슷한 사용자를 찾는다는 점이 중요한 차이다.

Embedding

신경망 기반 추천 시스템에서는 사용자와 상품을 숫자 벡터로 표현한다. 이를 embedding이라고 한다.

예를 들어 농구화가 다음과 같은 벡터로 표현될 수 있다.

[0.17, -0.42, 0.81, ..., 0.23]

벡터의 각 숫자 자체에 사람이 정한 의미가 있는 것은 아니지만, 학습이 잘 이루어지면 서로 비슷한 사용자나 상품의 embedding이 비슷한 위치에 형성된다.

Sequential Recommendation과 Direct Recommendation

ISRF는 두 가지 추천 문제를 다룬다.

Task목표직관적인 예
Sequential Recommendation사용자의 과거 interaction sequence를 보고 다음 아이템을 예측농구화 → 농구공 → 농구복 → 다음 상품?
Direct Recommendation여러 후보 아이템 중 사용자가 실제로 선호한 아이템을 식별100개 후보 중 실제 positive item 찾기

논문에서는 Sequential Recommendation을 사용자의 과거 상호작용 v1, v2, ..., vt로부터 다음 아이템 vt+1을 예측하는 문제로 정의한다.

Direct Recommendation에서는 실제 사용자가 상호작용했던 positive item 하나와 상호작용하지 않은 negative item들을 후보로 주고, 그중 positive item을 식별하게 한다. 실험에서는 1개의 positive item과 99개의 negative item을 사용한다.

이 논문은 왜 나오게 되었을까?

초기의 추천 시스템은 주로 User ID와 Item ID, 그리고 이들의 상호작용에 집중했다.

예를 들어 모델 입장에서는 농구화가 실제로 어떤 상품인지 알 필요 없이 단순히 Item_1827이라는 ID로만 존재할 수 있다.

문제는 이 경우 모델이 상품 자체의 의미를 직접 활용하기 어렵다는 것이다.

그래서 이후에는 상품의 제목, 카테고리, 브랜드, 설명과 같은 side information을 함께 활용하는 연구들이 등장했다.

LLM이 등장한 이후에는 이러한 텍스트 정보를 LLM으로 표현하여 사용자나 상품의 semantic embedding을 만드는 방법도 활발하게 연구되었다.

하지만 이 논문의 저자들은 여기서 한 단계 더 문제를 제기한다.

상품과 사용자의 semantic representation을 만드는 것만으로 사용자의 실제 관심사를 충분히 이해했다고 볼 수 있는가?

저자들은 단순한 Semantic Integration에서 끝나는 것이 아니라, 상품 속성으로부터 사용자의 관심사를 추론하고 다시 비슷한 사용자 집단으로부터 더 깊은 관심사를 추론하는 Semantic Reasoning이 필요하다고 본다.

[Figure 1 – 기존 Semantic Integration과 ISRF의 Semantic Reasoning 비교]

질문 1. Semantic Integration과 Semantic Reasoning은 무엇이 다른가?

먼저 직관적으로 이해하기

Semantic Integration은 상품의 의미 정보를 모델에 넣는 것에 가깝다.

예를 들어 어떤 농구화에 다음과 같은 속성이 있다고 해보자.

  • air-cushioned midsole
  • durable outsole
  • non-slip
  • hard-court용

Semantic Integration 방식에서는 이 텍스트들을 encoder나 LLM을 사용하여 embedding으로 변환하고 추천 모델에 넣는 식으로 사용할 수 있다.

반면 Semantic Reasoning에서는 이 속성에서 한 단계 더 나아간다.

“충격 흡수와 미끄럼 방지 기능이 중요한 농구화를 선택했으므로, 이 사용자는 하드코트에서의 운동 성능을 중요하게 생각할 수 있다.”

즉 상품의 속성을 그대로 사용하는 것이 아니라, 그 속성이 사용자 선호 관점에서 어떤 의미를 가지는가를 추론한다.

그리고 ISRF는 여기서 한 단계 더 나아가 비슷한 사용자들을 살펴본다.

비슷한 사용자들이 장시간 경기에서 lightweight, breathability, endurance와 관련된 특성을 중요하게 여긴다면, 해당 사용자의 interaction history에 직접 나타나지 않았더라도 이러한 잠재 선호가 있을 가능성을 모델링한다.

논문에서는 어떻게 설명하는가?

Figure 1에서 저자들은 기존 semantic integration과 ISRF를 비교한다. 상품의 air-cushioned midsole, durable outsole 등의 속성으로부터 먼저 individual explicit interest를 추론하고, 이후 similar users를 통해 group implicit interest를 찾는다.

따라서 이 논문의 핵심 흐름은 다음과 같다.

Item Attribute → Individual Explicit Interest → Similar User Group → Group Implicit Interest

오해하기 쉬운 표현

“기존 방법은 의미를 전혀 이해하지 못했고 ISRF만 의미를 이해한다”고 표현하면 과도하다.

더 정확하게는 기존 LLM 기반 추천 모델도 사용자와 아이템의 semantic representation을 사용한다. ISRF의 차이는 저자들이 이를 단순 semantic representation 또는 integration에서 explicit interest와 implicit group interest를 연결하는 단계적 reasoning으로 확장했다는 점에 있다.

ISRF의 전체 구조

논문의 Figure 2가 전체 모델 구조를 보여준다.

[Figure 2 – ISRF 전체 아키텍처]

크게 다음 세 부분으로 구성된다.

  1. Individual Interest Reasoning(IIR): 개별 사용자의 실제 interaction을 중심으로 explicit interest를 모델링한다.
  2. Group Interest Reasoning(GIR): 의미적으로 비슷한 사용자들의 정보를 이용해 group implicit interest를 모델링한다.
  3. Iterative Refinement(IR): 두 종류의 사용자 representation이 서로 보완되도록 정렬한다.

1. Individual Interest Reasoning

IIR의 목적은 사용자가 실제로 상호작용한 상품에서 Individual Explicit Interest를 얻는 것이다.

Item Attribute를 바로 embedding하지 않는다

이 논문의 특징 중 하나는 상품의 title, description, brand, category 같은 속성을 바로 embedding하는 데서 끝나지 않는다는 것이다.

먼저 LLM에게 여러 단계의 semantic reasoning을 수행하게 한다.

논문의 Appendix에 제시된 Item Semantic Reasoning prompt는 크게 다음 순서로 구성된다.

  1. 이 상품을 좋아할 가능성이 있는 사용자는 누구인가?
  2. 앞선 결과를 고려할 때 이 상품을 싫어할 가능성이 있는 사용자는 누구인가?
  3. Positive와 Negative 정보를 함께 고려했을 때 상품의 핵심 feature는 무엇인가?

예를 들어 스포츠용 물병의 경우 LLM은 먼저 운동 중 수분 섭취와 휴대성을 중요하게 생각하는 사용자가 선호할 수 있다고 추론한다.

반대로 스테인리스나 유리처럼 내구성이 높은 소재를 선호하는 사용자는 플라스틱 제품을 선호하지 않을 수 있다는 negative semantic information도 생성한다.

마지막으로 두 관점을 종합하여 “Portable and convenient for sports activities”와 같은 상품 feature를 생성한다.

[Figure 6 – Item Semantic Reasoning에 사용되는 Positive → Negative → Feature Prompt]

왜 Positive와 Negative를 모두 사용하는가?

Positive reasoning만 사용하면 해당 상품을 좋아하는 이유만 표현된다. Negative reasoning을 함께 사용하면 반대로 어떤 사용자는 이 상품을 선호하지 않을지까지 표현할 수 있다.

저자들은 이를 서로 보완적인 semantic perspective로 사용한다.

실험에서도 Positive 정보만 사용하거나 Negative 정보만 사용하는 variant보다 두 정보를 모두 사용한 full ISRF가 더 높은 성능을 보였다.

다만 이 결과는 “Negative reasoning이 항상 추천 성능을 향상시킨다”는 일반적인 인과관계를 증명한 것은 아니다. 이 논문의 데이터셋과 ISRF 설정에서 두 관점을 통합한 구성이 더 높은 성능을 보였다고 이해하는 것이 정확하다.

Semantic Text를 Embedding으로 변환

LLM이 생성한 feature는 여전히 텍스트이므로 추천 모델이 직접 계산할 수 있는 벡터 representation으로 변환해야 한다.

논문에서는 pre-trained text encoder인 EasyRec을 이용해 semantic embedding을 얻는다.

여기서 역할을 구분해서 보는 것이 중요하다.

모델논문에서의 역할
DeepSeek-R1-14B사용자와 상품에 대한 multi-step semantic reasoning
EasyRec생성된 semantic description을 embedding으로 변환
T5-small최종 generative recommendation backbone

즉 DeepSeek-R1-14B가 최종 추천 결과를 직접 생성하는 구조는 아니다.

PCA와 Adapter

논문은 얻어진 item semantic embedding을 그대로 recommendation embedding으로 사용하지 않는다.

먼저 PCA를 사용해 semantic representation의 차원을 줄이고, 이 representation을 training 중에는 고정한다.

그 다음 trainable Adapter를 사용해 semantic space의 representation을 recommendation space로 변환한다.

Ev=W2(W1S~v+b1)+b2E_v = W_2(W_1\tilde{S}_v+b_1)+b_2

여기서 Ṡv는 PCA를 적용한 item semantic representation이고, Ev는 최종 recommendation space에서 사용하는 item embedding이다.

직관적으로 Adapter는 LLM 기반 semantic space와 추천 모델이 사용하는 embedding space 사이를 연결하는 projection layer라고 이해하면 된다.

User-Item Graph와 LightGCN

이제 semantic item embedding과 실제 사용자 interaction을 함께 사용한다.

사용자와 상품을 node로 두고 사용자가 상품과 상호작용한 경우 edge로 연결하면 User-Item Graph를 만들 수 있다.

ISRF에서는 이 graph에 LightGCN을 적용한다.

E(l+1)=D−1/2AD−1/2E(l)E^{(l+1)}=D^{-1/2}AD^{-1/2}E^{(l)}

수식을 직관적으로 보면 각 node가 연결된 이웃의 embedding 정보를 전달받는 과정이다.

사용자는 자신이 상호작용한 item들의 정보를 받고, item 역시 자신과 상호작용한 user들의 정보를 받는다.

이 과정을 통해 얻어진 사용자 representation에는 실제 interaction pattern과 LLM으로 강화된 item semantic information이 함께 반영된다. 논문에서는 이를 사용자의 Individual Explicit Interest를 나타내는 representation으로 사용한다.

질문 2. Individual Explicit Interest와 Group Implicit Interest는 무엇인가?

먼저 직관적으로 이해하기

여기서 Explicit Interest라는 표현을 잘못 이해하기 쉽다.

이 논문에서 explicit이라는 말은 사용자가 “나는 농구를 좋아한다”고 직접 문장으로 말한 것을 의미하지 않는다.

보다 정확하게는 그 사용자가 실제로 수행한 interaction으로부터 직접 모델링할 수 있는 관심사를 의미한다.

예를 들어 한 사용자가 다음 상품을 구매했다고 하자.

  • 자전거 벨
  • 페달 반사판
  • 자전거 액세서리

이 interaction을 통해 자전거 관련 상품에 관심이 있다는 것을 모델링하는 것이 Individual Explicit Interest에 해당한다.

반면 이 사용자가 자전거 헤드라이트를 구매한 적은 없다고 하자.

그런데 의미적으로 비슷한 사용자들이 자전거 헤드라이트나 후미등을 많이 사용했다면 해당 사용자 역시 자전거 조명에 관심을 가질 가능성이 있다고 추론할 수 있다.

이렇게 현재 사용자의 interaction에 직접 나타나지 않은 관심사를 비슷한 사용자 집단으로부터 모델링한 것을 이 논문에서는 Group Implicit Interest로 본다.

논문에서는 어떻게 Group Interest를 만드는가?

우선 사용자의 interaction history에서 일부 item을 가져와 LLM에게 사용자의 semantic preference를 추론하게 한다.

Item reasoning과 유사하게 User reasoning도 Positive → Negative → Preference의 구조를 사용한다.

  1. 사용자가 어떤 스포츠나 상품을 좋아하는가?
  2. 어떤 스포츠나 상품을 싫어할 가능성이 있는가?
  3. 두 결과를 바탕으로 사용자의 핵심 관심사는 무엇인가?

[Figure 7 – User Semantic Reasoning Prompt]

이렇게 얻어진 user semantic representation들을 서로 비교한다.

사용자 간 유사도 계산에는 cosine similarity를 사용한다.

sim⁡(ui,uj)=ui⋅uj‖ui‖‖uj‖\operatorname{sim}(u_i,u_j)=\frac{u_i\cdot u_j}{\lVert u_i\rVert\lVert u_j\rVert}

Cosine similarity가 높다는 것은 두 사용자의 semantic embedding 방향이 비슷하다는 의미다.

ISRF는 각 사용자에 대해 가장 유사한 Top-K 사용자를 선택하고 이들을 연결하여 Similarity-based User Graph를 만든다.

그리고 이 User-User Graph에 다시 LightGCN을 적용한다.

그 결과 한 사용자의 representation에는 본인뿐 아니라 의미적으로 유사한 이웃 사용자들의 정보가 aggregate된다. 논문에서는 이 representation을 Group Implicit Interest로 활용한다.

논문의 Case Study

이 개념은 논문의 Figure 5가 가장 이해하기 쉽다.

한 사용자의 최근 interaction에는 Pedal Reflector Set, Cycle Horn, Bicycle Bell 등 자전거 관련 상품이 포함되어 있다.

기존 ELMRec은 Match Container Kit이나 Ball Pump Kit과 같은 상품을 추천한다.

반면 ISRF는 해당 사용자와 semantic preference가 비슷한 사용자들이 Cycling Lights, Taillights, Headlights 관련 상품과 상호작용했다는 정보를 활용한다.

이를 바탕으로 해당 사용자의 잠재 관심사를 Headlights와 관련된 방향으로 모델링하고 Bicycle Light와 Bicycle Headlight Torch 같은 상품을 추천한다.

[Figure 5 – Similar User를 활용해 Group Implicit Interest를 추론한 Case Study]

오해하기 쉬운 표현

“ISRF가 사용자의 진짜 숨겨진 욕구를 발견했다”고 표현하면 너무 강한 해석이 된다.

논문에서 실제로 수행하는 것은 LLM 기반 semantic user representation을 만들고, 이 representation이 유사한 Top-K 사용자를 연결한 뒤 GNN으로 정보를 aggregate하는 것이다.

따라서 더 정확한 표현은 “비슷한 사용자의 semantic interaction pattern을 이용해 현재 사용자에게 직접 관찰되지 않은 잠재 preference representation을 모델링한다” 정도다.

2. Group Interest Reasoning의 Top-K는 왜 필요한가?

모든 사용자를 모든 사용자와 연결하면 관련성이 낮은 사용자 정보까지 함께 섞일 수 있고 계산량도 커진다.

그래서 ISRF에서는 각 사용자에 대해 cosine similarity가 높은 Top-K 사용자만 선택한다.

실험 결과 K를 증가시키면 처음에는 성능이 좋아지지만 너무 많은 사용자를 포함하면 성능이 다시 감소하는 패턴이 관찰되었다.

Sequential Recommendation에서는 세 데이터셋 모두 K=100에서 가장 높은 결과를 얻었고, Direct Recommendation에서는 Beauty와 Toys가 K=100, Sports가 K=50에서 가장 높은 결과를 얻었다.

저자들은 지나치게 큰 K가 noise를 유입할 수 있다고 설명한다.

[Figure 8 – Top-K Similar Users 변화에 따른 성능 변화]

질문 3. Individual과 Group Interest를 왜 다시 Iterative Refinement 해야 하는가?

먼저 직관적으로 이해하기

IIR과 GIR을 거치면 한 사용자에 대해 서로 다른 두 종류의 representation이 만들어진다.

Representation의미
Individual Explicit Interest본인이 실제로 상호작용한 item들을 중심으로 학습한 관심사
Group Implicit Interest의미적으로 비슷한 사용자 집단에서 얻은 잠재 관심사

두 representation을 완전히 독립적으로 학습시키면 서로 다른 방향으로 형성될 수 있다.

예를 들어 사용자의 실제 interaction을 기반으로 한 representation은 농구 관련 성향을 강하게 나타내는데, Group representation이 전혀 다른 취향을 강조한다면 두 정보를 함께 사용하는 의미가 약해진다.

그래서 ISRF는 두 representation이 서로 일관성을 가지도록 alignment를 수행한다.

Contrastive Learning으로 Representation을 정렬한다

여기서 사용되는 핵심 개념이 Contrastive Learning이다.

직관적으로는 같은 사용자에서 나온 두 representation은 가까워지게 하고, 다른 사용자의 representation과는 구별되도록 학습하는 방식이다.

예를 들어 사용자 A의 Individual Interest와 Group Interest는 서로 가까워지도록 한다.

Individual(A) ↔ Group(A): 가까워짐

반면 다른 사용자 B의 representation과는 구별될 수 있도록 한다.

Individual(A) ↔ Group(B): 상대적으로 멀어짐

논문은 Direct Recommendation과 Sequential Recommendation에서 서로 다른 alignment loss를 사용한다.

Direct Recommendation에서는 contrastive distillation loss를 사용하고, Sequential Recommendation에서는 group interest representation과 sequence 기반 user preference representation 사이의 contrastive objective를 사용한다.

최종 학습 목적 함수

전체 학습에서는 추천 결과를 생성하기 위한 generation loss와 representation alignment를 위한 loss를 함께 사용한다.

ℒ=ℒgen+ℒalignment\mathcal{L}=\mathcal{L}_{gen}+\mathcal{L}_{alignment}

정확히는 Direct Recommendation에서는 generation loss에 Direct-to-Sequential alignment loss를 더하고, Sequential Recommendation에서는 generation loss에 sequential contrastive loss를 더한다.

오해하기 쉬운 표현

Iterative Refinement를 “LLM이 여러 번 생각하면서 스스로 답을 고친다”고 이해하면 정확하지 않다.

여기서 iterative라는 것은 reasoning text를 반복 생성한다는 의미보다는, individual interest와 group interest의 representation을 학습 과정에서 서로 정렬하고 보완하는 optimization 구조에 가깝다.

Generative Recommendation은 기존 추천과 무엇이 다른가?

전통적인 추천 시스템은 보통 각 item에 score를 계산하고 가장 높은 item들을 선택한다.

예를 들어 다음과 같다.

Item A: 0.91
Item B: 0.83
Item C: 0.44

반면 Generative Recommendation은 추천 문제를 language generation problem처럼 표현한다.

사용자의 history와 prompt를 LLM에 제공하고 모델이 최종적으로 추천해야 할 item token을 생성하도록 학습한다.

ISRF에서는 T5-small을 generative recommendation backbone으로 사용하며, user/item에 해당하는 embedding을 LLM 입력과 결합한다.

추론 시에는 beam search를 사용해 recommendation result를 생성한다.

실험 설정

논문은 Amazon 기반의 세 benchmark dataset에서 ISRF를 평가한다.

DatasetUsersItemsReviews
Toys19,41211,924167,597
Beauty22,36312,101198,502
Sports35,59818,357296,337

각 사용자의 interaction history에서 마지막 interaction을 test, 두 번째로 마지막 interaction을 validation, 나머지를 training에 사용한다.

비교 대상에는 Caser, GRU4Rec, SASRec, BERT4Rec 같은 sequential recommendation 모델, LightGCN, NCL, XSimGCL 같은 GNN 기반 모델, P5, RSL, POD, ELMRec 같은 LLM 기반 모델이 포함된다.

모든 실험은 PyTorch로 구현되었고, 논문에 따르면 NVIDIA GeForce RTX 4090 24GB 한 장에서 수행되었다.

평가 지표: Hit Rate와 NDCG

Hit Rate@K

Hit Rate@K는 정답 item이 모델이 추천한 Top-K 안에 들어갔는지를 보는 지표다.

예를 들어 실제 정답이 Item 42이고 모델의 Top-5 결과가 다음과 같다고 하자.

  1. Item 91
  2. Item 31
  3. Item 42
  4. Item 72
  5. Item 11

정답 Item 42가 Top-5 안에 있으므로 해당 sample은 Hit가 된다.

따라서 Hit Rate는 직관적으로 정답을 추천 후보 안에 포함시키는 능력을 측정한다고 볼 수 있다.

NDCG@K

Hit Rate에는 정답이 1위에 있든 10위에 있든 Top-10에 포함되기만 하면 동일하게 Hit로 처리된다는 한계가 있다.

NDCG는 정답의 ranking position까지 고려한다.

따라서 같은 정답을 맞혔다고 하더라도 1위에 배치한 경우가 10위에 배치한 경우보다 높은 평가를 받는다.

이 논문에서는 H@5, H@10, NDCG@5, NDCG@10을 사용한다.

주요 실험 결과

논문의 Table 1과 Table 2에서는 Sequential Recommendation과 Direct Recommendation의 성능을 각각 비교한다.

[Table 1 – Sequential Recommendation 성능 비교]

[Table 2 – Direct Recommendation 성능 비교]

Sequential Recommendation

ISRF는 Sports, Beauty, Toys의 세 데이터셋에서 모든 주요 metric 기준으로 비교 baseline보다 높은 결과를 기록했다.

예를 들어 H@10 기준으로 Sports에서는 ELMRec이 0.0616, ISRF가 0.0648을 기록했다. Beauty에서는 ELMRec이 0.0750, ISRF가 0.0800을 기록했다.

저자들은 이러한 결과를 Group Interest Reasoning과 Iterative Refinement를 통해 사용자 interest를 여러 수준에서 모델링한 효과와 연결해 해석한다.

Direct Recommendation

Direct Recommendation에서는 ISRF와 기존 LLM 기반 baseline인 ELMRec의 차이가 더 크게 나타난다.

DatasetELMRec H@10ISRF H@10
Sports0.64790.7697
Beauty0.67940.7673
Toys0.60450.6733

논문에서는 Direct Recommendation이 unseen candidate item의 의미를 이해하는 능력에 더 크게 의존하기 때문에 semantic modeling의 장점이 상대적으로 크게 나타날 수 있다고 해석한다.

여기서 주의할 점은 이 실험 결과가 “semantic reasoning 때문에 성능이 반드시 이만큼 상승한다”는 일반적인 인과관계를 증명한 것은 아니라는 점이다. 논문에서 설정한 benchmark와 비교 조건에서 ISRF가 더 높은 성능을 보였다고 표현하는 것이 정확하다.

Ablation Study로 각 모듈의 역할 확인하기

Ablation Study에서는 모델의 일부 요소를 제거하여 해당 요소가 성능에 어떤 영향을 주는지 확인한다.

[Table 3 – ISRF Ablation Study]

Direct Recommendation의 Toys 데이터셋에서 전체 ISRF의 H@10은 0.6733이다.

Item Semantic Representation을 제거한 경우에는 0.5093으로 감소하고, Adapter를 제거한 경우에는 0.6314로 감소한다.

Beauty와 Sports에서도 유사한 성능 감소가 관찰된다.

따라서 이 실험에서는 LLM 기반 item semantic reasoning과 semantic embedding을 recommendation space로 변환하는 Adapter가 모두 성능에 기여하는 것으로 관찰된다.

Sequential Recommendation에서도 alignment 관련 loss를 제거하면 성능이 감소한다. 저자들은 이를 explicit interest와 group implicit interest를 서로 정렬하는 과정의 필요성을 뒷받침하는 결과로 해석한다.

Positive와 Negative Semantic Reasoning의 효과

저자들은 Positive semantic information만 사용하는 모델과 Negative semantic information만 사용하는 모델도 따로 비교한다.

[Figure 3 – Positive/Negative Semantic Variant 비교]

실험에서는 Positive와 Negative를 모두 포함하는 full ISRF가 각 단일 variant보다 높은 결과를 보였다.

또한 Positive-only와 Negative-only의 성능 차이가 크지 않은 경우도 관찰되었다.

저자들은 이를 Positive와 Negative semantic information이 서로 보완적인 정보를 제공하는 결과로 해석한다.

LightGCN을 깊게 쌓으면 더 좋아질까?

항상 그렇지는 않았다.

논문에서는 Group Interest Reasoning에 사용되는 LightGCN layer 수를 변화시키며 성능을 비교한다.

layer 수가 증가하면 처음에는 성능이 향상되지만 어느 지점 이후에는 성능이 정체되거나 일부 감소하는 결과가 관찰된다.

저자들은 지나치게 깊은 graph propagation이 over-smoothing이나 noise accumulation을 일으킬 수 있다고 설명한다.

[Figure 4 – LightGCN Layer 수에 따른 성능 변화]

계산 비용은 얼마나 증가하는가?

ISRF는 여러 semantic reasoning과 graph module을 추가하므로 계산 비용도 확인할 필요가 있다.

논문의 Table 4에서 ISRF는 ELMRec보다 training time이 증가하지만 GPU memory 사용량과 inference time은 전반적으로 비슷한 수준이다.

DatasetModelTrain TimeGPU Memory
SportsELMRec10m10s / epoch23.58 GB
SportsISRF15m01s / epoch24.19 GB
BeautyELMRec6m13s / epoch21.93 GB
BeautyISRF8m04s / epoch22.12 GB
ToysELMRec5m07s / epoch21.15 GB
ToysISRF5m42s / epoch21.78 GB

[Table 4 – ELMRec과 ISRF의 계산 비용 비교]

논문의 핵심 Contribution은 무엇인가?

이 논문의 contribution을 “LLM을 추천에 사용했다”라고 정리하면 핵심을 놓치게 된다.

LLM 기반 recommendation, LightGCN, Contrastive Learning 자체는 기존에 존재하는 방법이다.

이 논문에서 중요한 것은 이 요소들을 Individual Explicit Interest → Group Implicit Interest → Iterative Refinement라는 구조로 연결했다는 점이다.

저자들이 제시하는 주요 contribution은 다음과 같이 정리할 수 있다.

  1. Generative Recommendation에 semantic reasoning 관점을 도입하고, individual explicit interest와 group implicit interest를 함께 모델링했다.
  2. Item semantic reasoning에서 시작해 similar user graph를 통한 group interest reasoning으로 확장하는 구조를 제안했다.
  3. Individual과 Group Interest를 Iterative Refinement를 통해 정렬하는 학습 방식을 제안했다.
  4. Sports, Beauty, Toys 데이터셋의 Direct 및 Sequential Recommendation 실험에서 기존 baseline보다 높은 성능을 관찰했다.

전체 구조를 다시 한 번 정리하면

Individual Interest Reasoning의 흐름은 다음과 같다.

Item Attributes → LLM Positive/Negative Reasoning → Item Feature → Text Embedding → PCA → Adapter → User-Item Graph → LightGCN → Individual Explicit Interest

Group Interest Reasoning의 흐름은 다음과 같다.

User History → LLM Positive/Negative Reasoning → User Preference → Semantic Embedding → Cosine Similarity → Top-K Similar Users → User-User Graph → LightGCN → Group Implicit Interest

그리고 마지막으로 Individual Interest와 Group Interest를 contrastive objective를 이용해 정렬하고, 이를 Generative Recommendation model에 반영한다.

논문을 읽고 기억해야 할 핵심

이 논문을 가장 단순하게 표현하면 다음과 같다.

“네가 어떤 상품을 사용했는지만 보는 것이 아니라, 그 상품을 왜 좋아했을 가능성이 있는지 의미적으로 추론하고, 너와 비슷한 사람들이 무엇을 좋아하는지까지 이용해 아직 행동으로 나타나지 않은 관심사를 모델링하자.”

따라서 ISRF를 이해할 때 가장 중요한 흐름은 다음 하나라고 생각한다.

Item Semantics → Individual Explicit Interest → Group Implicit Interest → Iterative Refinement → Recommendation

기존 LLM 기반 추천이 semantic representation을 풍부하게 만드는 데 집중했다면, ISRF는 저자들의 표현대로 이를 semantic reasoning의 관점으로 확장한다.

논문의 한계와 남는 질문

논문이 실험적으로 보여준 것은 Amazon의 Sports, Beauty, Toys 세 benchmark에서 ISRF가 비교한 baseline보다 높은 추천 성능을 기록했다는 것이다.

따라서 이 결과만으로 모든 추천 도메인이나 실제 서비스 환경에서도 같은 성능 향상이 발생한다고 결론 내릴 수는 없다.

또한 논문에서 Group Implicit Interest라고 부르는 정보가 사용자의 실제 잠재 관심사를 얼마나 정확하게 표현하는지는 Figure 5의 case study를 통해 사례 수준에서 보여준다. 이를 사용자의 실제 심리적 선호를 직접 측정한 결과로 해석해서는 안 된다.

그리고 semantic reasoning 자체가 생성한 텍스트의 품질을 별도의 human evaluation으로 측정하기보다는 최종 recommendation 성능을 중심으로 평가한다.

저자들은 future work로 LLM에 다양한 reasoning strategy를 추가하여 reasoning capability를 더욱 강화하는 방향을 제시한다.

마무리

개인적으로 이 논문을 이해할 때 가장 중요한 부분은 복잡한 수식보다 두 종류의 사용자 관심사를 어디에서 얻는가를 구분하는 것이다.

User-Item Graph에서 얻은 것은 사용자가 실제로 보여준 interaction을 중심으로 한 Individual Explicit Interest이고, Semantic User-User Graph에서 얻은 것은 비슷한 사용자 집단을 통해 확장한 Group Implicit Interest다.

ISRF는 이 둘 중 하나를 선택하는 것이 아니라 두 representation을 함께 사용하고, Iterative Refinement를 통해 서로 일관된 방향으로 학습시키는 것을 목표로 한다.

결국 이 논문의 질문은 단순하다.

추천 시스템이 “사용자가 무엇을 했는가”를 아는 것에서 한 단계 더 나아가, “왜 그것을 좋아했을 가능성이 있으며 비슷한 사람들은 또 무엇을 좋아하는가”까지 모델링할 수 있을까?

ISRF는 이에 대해 LLM 기반 semantic reasoning과 graph-based collaborative information을 결합하는 하나의 방법을 제안한 연구라고 정리할 수 있다.

#Collaborative Filtering#Contrastive Learning#DeepSeek#Generative Recommendation#GNN#ISRF#LightGCN#LLM#Recommender System#Semantic Reasoning#Sequential Recommendation#WWW 2026#논문리뷰#추천시스템

You might also like

큰 배치는 왜 일반화가 나빠질까? Sharp Minima와 Mini-batch Noise 정리

#Batch Size#Flat Minima#Generalization Gap

[Xavier 초기화] 깊은 신경망은 왜 학습되지 않았을까?

#Sigmoid#Vanishing Gradient#Xavier 초기화

고전 데이터는 어떻게 양자가 될까? (QML Encoding부터 VQC까지 정리)

#Data Encoding#Entanglement#Machine Learning

Comments (0)

Leave a Reply

Or login to comment with your account.

No comments yet. Be the first to share your thoughts!