전체 글 100

데이터 분석 트랙 19주차 (25.06.29.) W.I.L.

[최종 프로젝트 진행상황]1. 이탈 예측 및 고객 별 상품 추천 시스템 구현 - 전체 기간을 마지막 3개월과 전체 기간으로 분리하여 머신러닝 테스트를 진행 - 신뢰도 및 재현율이 가장 높은 대상을 최종 선택 - 상품 추천을 위한 협업 필터링 기반 추천 시스템과, APRIORI 기반 장바구니 연관 상품 추천 시스템 구현 - 시각화를 위한 준비 시작 2. 대시보드 구상 시작 - 현재 대시보드 제작의 목적은 오프라인 마켓의 온라인 서비스 런칭 혹은 전환을 위한 전략을 제시하기 위함! - 대시보드 확인자는 최종 경영권자(마트의 전체 상황을 확인하고 싶어함), CRM 마케터(RFM 분석을 통한 고객 SEGMENT별 특징 및 이탈고객 확인, 고객 행동 분석을 통한 새로운 마케팅 전략 수립을 하고싶어함)으로 생각하..

내일배움캠프 2025.06.29

데이터 분석 트랙 97일차 25.06.26. [TIL]

[최종 프로젝트 진행 상황]상품추천 시스템 구현 완료대시보드 구상 시작- 협업 필터링을 통한 상품 추천 시스템 구현 완료# 1. 데이터 전처리 "고객-상품 매트릭스 생성"# 설명 : 고객(household_key)과 상품(PRODUCT_ID)의 구매 수량 데이터를 집계하여 기초 상호작용 테이블을 생성df_matrix = df_cleaned[['household_key', 'PRODUCT_ID', 'QUANTITY']].copy()df_matrix['QUANTITY'] = df_matrix['QUANTITY'].astype(int)df_matrix = df_matrix.groupby(['household_key', 'PRODUCT_ID'])['QUANTITY'].sum().reset_index()# 2. ..

카테고리 없음 2025.06.26

데이터 분석 트랙 96일차 25.06.25. [TIL]

[최종 프로젝트 진행 상황]상품추천 시스템 구현상품 추천의 유형을 1. 특정 고객의 상품 A의 구매력을 높힌다. => 협업 필터링을 통해 상품 유사도를 계산한 뒤 고객의 행동 패턴을 결합해 상품을 추천한다.2. 상품 A를 구매할 때 상품 B를 구매할 수 있게 상품을 추천한다. => APRIORI를 통한 장바구니 내 상품 유사도를 확인하여 연관 상품을 추천한다. 현재 2가지 유형을 다 진행하기로 계획본인은 상품 추천 유형 1을 진행하기로 했다.현 목표 : 고객-상품 메트릭스를 만든 뒤 상품 간 유사도를 계산 한 뒤 개인별 상품 추천 시스템을 구현한다. ex. 고객이 A상품을 살 때 구매 확률을 높이기! [고객님과 유사한 구매패턴을 가진 고객님은 ~~상품을 사셨습니다.] ⇒ Segment별 상품 기획전, A..

내일배움캠프 2025.06.25

데이터 분석 트랙 95일차 25.06.24. [TIL]

[최종 프로젝트]진행 상황 1. (오전~오후 3시) 이탈 예측 관련 머신러닝 모델링을 진행! - 피쳐 엔지니어링 및 XGBoost 2~3차 학습 및 성능평가(precision, recall, f1-score), SHAP를 통한 주요 피쳐 확인, - 베이스라인 정확도와 불균형 클래스 처리, threshold 튜닝을 하며 성능평가를 시도 2. 튜터 멘토링 2.1. 문제 상황 1 A. 현황 설명 :각 팀원 별로 모델링 및 성능평가를 시도했는데 성능 평가가 너무 좋게 나와(정확도가 1 혹은 그에 수렴) 과적합 문제인지 추가적 개선이 필요한 것인지 모르겠다. B. 사용 모델 : 현재 사용한 모델은 랜덤 포레스트와 SVD, SGBoost 모델들이다. C. 분석목표 : 오프라인 매장의 온라인 전환으..

카테고리 없음 2025.06.24

데이터 분석 트랙 94일차 25.06.23. [TIL]

최종 프로젝트 머신 러닝# 이탈 분석을 위한 머신러닝(현재 팀 내 개인 별로 진행) 0. 시계열 분석을 통한 이탈 간격 확인 0.1. 전체 고객군의 이탈 간격 # 해석 : 첫 구매후 재방문까지 걸리는 시간의 대부분이 30일을 기점으로 이루어진다. 0.2. Segment별 이탈 통계 및 이탈 비율SegmentcountmeanmedianminmaxChurn Risk93858.51125.03658Growth Potential53515.2977.01259Active Low Value7193.8182.0176Top Value3082.0292.015 Recency_Bin0-7d8-14d15-30d31-60d61-90d91-180d180d+Segment Active Low Value000.0761.0..

내일배움캠프 2025.06.23

데이터 분석 트랙 18주차 (25.06.22.) W.I.L.

[주간 회고]최종 프로젝트1. 진행사항 : RFM Segment를 완료, ARPU, BS, CLV를 통한 통계 검정(Shapiro-Wilk, Levene,Kruskal-Wallis, Dunn's test 완료)을 통해 신뢰도 보완 완료 - 고객 추천 시스템을 위한 머신러닝을 계획중def classify_final_segment(row): if row['RF_Level'] == 'High_RF': if row['M_Score'] == 5: return 'Top Value' # 최고 고객군 else: return 'Active Low Value' elif row['RF_Level'] == 'Mid_RF': if row[..

내일배움캠프 2025.06.22

데이터 분석 트랙 94일차 25.06.19. [TIL]

[최종 프로젝트]1. 진행 상황 - RFM Segment 진행# RFM Segment # 앞선 내용을 통해 차후 북극성 지표가 될 VIP와 Churn Risk 컬럼을 설정 그들의 특징을 파악할 것임# 이제 세부적으로 잠재적 VIPdef assign_segment(rfm_row): if rfm_row['R_Score'] == 5 and rfm_row['F_Score'] == 5 and rfm_row['M_Score'] == 5: return 'VIP' elif rfm_row['R_Score'] >= 4 and rfm_row['F_Score'] >= 4 and rfm_row['M_Score'] >= 4: return 'Poten_VIP' # 3으로 설정해도 좋은 것이..

카테고리 없음 2025.06.19

데이터 분석 트랙 93일차 25.06.18. [TIL]

[최종 프로젝트]RFM Segment 0. 분석 방향 : RFM 스코어링 이후 기술 통계를 통한 값을 확인한 뒤 1차 RF, 2차 M을 활용해 점수 조합 및 Segment 및 페르소나 설정 후 이상치인 고객의 수 및 비율을 확인하여 신뢰성을 확보한다.- 최종적으로 Segment별 특징을 확인하여 Segment별 인사이트를 도출한다. 1. Recency, Frequency, Monetary 기술 통계 RecencyFrequencyMonetarymean26.58110.223222.98std62.79115.273349.03min118.1725%238970.7450%7782157.7575%211424413.32max658129838319.79 2. R, F, M Score별 범위 및 특성 확인 - 스코어별 기술..

카테고리 없음 2025.06.18

데이터 분석 트랙 92일차 25.06.17. [TIL]

[최종프로젝트 진행 상황] 중간 보고서 작성[중간정리] 중간 보고 발표자료 제작 중간 보고서 [중간정리]1. 프로젝트 개요 1.1. 프로젝트 이름 : Digital Transformation Strategy 1.2. 분석 목적 : 커머스 마켓 오프라인 고객 기반 디지털 전환 전략 1.3. 데이터 출처 : " Dunnhumby - The Complete Journey" 1.4. 분석 대상 및 범위: 2019~2021년 사이의 고객 거래 데이터를 대상으로 분석 1.5. 예상 결과물 A. 전체 EDA : "2019~21년도 마켓의 현황(및 성과) 파악 및 시각화" B. 인사이트 - 기존 캠페인의 한계(캠페인 타겟 및 상품의 특이성 없이 그저 다수에게 다양한 상품을 엮은 쿠폰 마케팅). - 타..

카테고리 없음 2025.06.17