| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- tableau
- 검색증강생성
- customeoperator
- 소규모언어모델
- GoEmotions
- 텍스트마이닝
- agglomerative clustering
- 금융보고서
- 감성분석
- 통계개념
- LDA
- 데이터
- datacrawling
- 토픽모델링
- 오블완
- customoperator
- RapidMiner
- 머신러닝
- pythonlearner
- 데이터분석
- 데이터크롤링
- 래피드마이너
- 파이썬러너
- featureimportance
- llma
- 티스토리챌린지
- sentimentanalysis
- 커스텀오퍼레이터
- 지식그래프임베딩
- htmltags
- Today
- Total
목록전체 글 (18)
마이와 텍스트마이닝
Evaluating Small Language Models for Financial Question Answering: A Comparative Analysis in RAG Systems 최근 다양한 도메인에서 대형 언어 모델(LLM)이 활발하게 도입되고 있습니다. 하지만 금융 분야에서는 모델의 단순한 문장 생성 능력을 넘어, 정확한 정보 검색과 수치 추론 능력이 매우 엄격하게 요구됩니다. 이번 프로젝트는 "RAG(Retrieval-Augmented Generation) 환경을 구축하면, 소규모 LLM(Small Language Models)도 복잡한 금융 문서에 대한 질의응답을 효과적으로 수행할 수 있을까?"라는 질문에서 출발했습니다. 1. 핵심 데이터셋: FinDER금융 분야의 질의응답 성능을 ..
1. 프로젝트 배경: 개발자들은 정말 AI를 신뢰할까?2022년 말 ChatGPT의 등장 이후, 생성형 AI는 소프트웨어 산업의 패러다임을 완전히 바꿔놓았습니다. 코딩, 디버깅 등 개발 워크플로우 전반에 AI가 스며들고 있죠.하지만 여기서 한 가지 의문이 들었습니다. "개발자들이 AI를 많이 쓴다고 해서, 정말로 AI를 신뢰하고 긍정적으로 생각할까?" 이 질문에 답하기 위해, 소프트웨어 생태계에서 AI 도입이 폭발적으로 일어난 2023년부터 2025년까지의 종단면(Longitudinal) 데이터를 분석해 보기로 했습니다.2. 데이터 및 시각화 분석 도구 (Tableau)데이터의 흐름과 숨겨진 패턴을 직관적으로 파악하기 위해 태블로(Tableau)를 시각화 분석 도구로 활용했습니다.데이터 소스: 전 세..
지식 그래프 기반 임베딩을 활용한 서울시 NO₂ 농도 예측Knowledge Graph-Based NO₂ Concentration Prediction Using Seoul S-DOT Data1. 프로젝트 소개 연구 배경기존 도시 데이터 분석은 개별 센서의 측정값 중심으로 분석센서 간 공간적 관계와 도시의 계층적 구조를 충분히 반영하기 어려움단순한 좌표 기반 분석을 넘어 도시 공간 구조를 고려한 예측 모델 필요연구 목적서울시 S-DOT 데이터를 활용한 NO₂ 농도 예측센서 간 공간적 관계와 행정구역 구조를 Knowledge Graph로 구축Knowledge Graph 기반 Node2Vec 임베딩을 예측 변수로 활용지식 그래프 임베딩이 NO₂ 예측 성능에 미치는 영향 검증SHAP 및 Reverse Mappin..
데이터에 대한 이해를 높이기 위해 통계 함수와 그 분석은 매우 중요한 역할을 합니다. 또한 머신러닝 알고리즘에서도 필수적으로 사용되며, 중요한 기반이 됩니다. 이번 글에서는 파이썬을 이용해 기본적인 통계 기법들을 살펴보겠습니다. 이러한 기법들은 EDA(탐색적 데이터 분석) 과정에서도 자주 활용됩니다. 먼저 데이터를 불러오겠습니다. Kaggle에서 다운로드한 customer churn 데이터입니다.https://www.kaggle.com/datasets/muhammadshahidazeem/customer-churn-dataset Customer Churn DatasetPredict Customer's Retentionwww.kaggle.com import pandas as pdimport numpy as ..
안녕하세요! 이번 프로젝트는 CarSales 데이터를 사용하여 SQL 쿼리와 파이썬을 활용한 분석을 진행하는 프로젝트입니다. 차량 판매 데이터는 여러 변수들, 예를 들어 차량 가격, 연식, 주행 거리, 연료 종류, 차체 형태 등의 정보를 포함하고 있습니다. 이러한 데이터들을 분석하여 유용한 인사이트를 도출하고, 이를 시각적으로 표현하는 것이 주요 목표입니다. 이 프로젝트의 첫 번째 단계에서는 SQL을 이용해 데이터를 로딩하고, 여러 테이블을 생성한 후, 다양한 분석 쿼리를 실행하여 데이터의 특성을 파악합니다. 또한, 데이터 분석 후에는 Tableau를 사용해 시각화를 진행하여 더욱 직관적으로 분석 결과를 전달하고자 합니다. 이 글에서는 첫 번째 단계인 데이터 로딩과 SQL 쿼리 실행, 그리고 Tablea..
안녕하세요~~ 오늘은 Beautiful Soup을 사용해 웹사이트 데이터를 크롤링하는 방법에 대해서 이야기해볼게요! 제가 크롤링할 웹사이트는 ISRI라는 Information Systems 관련 모델과 구성 요소 정보가 있는 웹사이트입니다. 이 정보를 데이터프레임으로 정리하여 CSV 파일로 저장할 예정입니다. https://isri.sciencesphere.org/index.php?o=constructs 👉🏻 크롤링할 링크입니다. 이 링크에 다양한 construct들이 나열된 목록이 있습니다. 이 목록에 있는 각 construct의 링크에 들어가서 해당 construct의 이름, 정의, 이론/모델, 참조 정보들을 추출할 예정입니다. 그리고 이 데이터를 데이터프레임에 추가할거예요. # import l..
오늘은 "클러스터링"에 대해 다루어보겠습니다. 클러스터링은 데이터를 비슷한 그룹으로 나누는 작업인데요, K-Means와 Agglomerative Clustering을 사용해 고객 데이터를 클러스터링하고, PCA 기법을 통해 결과를 개선하겠습니다. > Kaggle에서 제공하는 고객 데이터를 사용했어요~import pandas as pdimport numpy as npfrom sklearn.preprocessing import MinMaxScalerimport matplotlib.pyplot as pltimport pandas as pdfrom sklearn.preprocessing import LabelEncoderimport seaborn as snsfrom matplotlib import colorsf..
최근에 LLM(Large Language Models)이 큰 주목을 받고 있죠. 저도 이 분야에 관심이 생겨, 여러 자료를 찾아보고 공부하다 보니 생각보다 정말 깊이 있고 복잡한 개념들이 많더라고요! 하지만 "시작이 반"이라는 말도 있듯이, 배움의 첫 단계로 모델을 다운받아 간단한 챗봇을 만들어보기로 했어요. 😊 앞으로 차근차근 더 깊이 공부하며 성장할 계획입니다! Streamlit이란?Streamlit은 머신러닝 및 데이터 과학 웹 애플리케이션을 빠르고 쉽게 구축하고 공유할 수 있도록 해주는 무료 오픈 소스 프레임워크입니다. 저도 이번 프로젝트를 통해 처음으로 Streamlit을 접했는데, 정말 유용한 도구라는 걸 깨달았어요. 웹 애플리케이션뿐 아니라, 자신의 포트폴리오나 개인 웹사이트 등을 만드는 ..