1. 카이제곱 독립성 검정- 두 범주형 변수가 서로 독립적인지(관련이 없는지) 검증- 카이제곱 통계량(χ^2)값과 자유도(df)를 사용하여 p-value를 구하고, 유의 수준과 비교1) 카이제곱 통계량(χ^2): 관찰된 데이터와 기대된 데이터의 차이- χ^2이 작다면, 관찰된 데이터와 기대 데이터간의 차이가 작기 때문에 귀무가설이 참일 가능성이 높다.2) 자유도(df): 교차표에서 가능한 독립적인 정보의 수3) p-value: 현재 데이터가 귀무가설을 따를 가능성- 귀무가설: 두 변수는 독립적이다. (p-value > 유의수준(보통 0.05))* 카이제곱 통계량(χ^2) 의 다른 용도1) 적합도 검정: 관찰된 데이터가 이론적으로 기대되는 분포에 얼마나 잘 맞는가?- 데이터가 정규분포를 따르는가? 던진 ..
1. 특정 열의 데이터 글자 수 확인: df['컬럼명'].str.len()import pandas as pd# 글자수가 8개인지 확인df[df['신고일자'].str.len() != 8] 2. 특정 글자수가 아니면 앞에 0 채우기: str.zfill(글자수)df['신고시각'] = df['신고시각'].str.zfill(6)3. 날짜 형식으로 바꾸기: pd.to_datetime(df['컬럼명'])df['신고시간'] = pd.to_datetime(df['신고시간'])df['출동시간'] = pd.to_datetime(df['출동시간'])4. 시간 차이(데이터 타입: timedelta) 초 형식으로 바꾸기df['소요시간'] = df['소요시간'].dt.total_seconds()5. (참고) ns(나노 세컨드)를 ..
1. 문제 - Docker Desktop을 설치 했는데 실행이 되지 않는다문제1) 검색해보니 MySQL과 같은 3306포트를 쓰기 때문이라고 - 포트를 변경했지만 vscode에서 wsl 설치하라고 해서 설치했더니 docker desktop이 다시 실행하지 않는다.문제2) Docker desktop의 환경이 손상되거나, WSL과의 충돌 문제가 발생할 경우 2. MySQL 포트 변경- C:\ProgramData\MySQL\MySQL Server 8.0 경로로 들어가 my.ini 파일 수정 → port = 3306을 다른 숫자로 (나는 43306)- ProgramFile이 아닌 ProgramData임에 주의!!- 수정 권한이 없을 경우 my.ini 우클릭>속성>보안>system클릭 후 편집>users 클릭> ..
1. MySQL이란?- 관계형 데이터베이스로서 데이터를 구조적으로 저장하고 관리하기 위해 사용(속도, 신뢰성)- SQL: Structured Query Language- 관계형 데이터베이스 관리 시스템(RDBMS) 비교OracleMySQLPostgreSQL- 유료- 대규모 트랜잭션에 최적화- 높은 학습 곡선- 금융, 대규모 ERP, 복잡한 트랜잭션 등- 무료(커뮤니티 버전)- 읽기 작업에 특화, 중소규모에 적합- 상대적으로 쉬움- 중소규모 웹앱, 전자상거래, 블로그 등- 무료- 대규모 데이터 및 트랜잭션에 강점- 중간 수준- 데이터 분석 플랫폼, 복잡한 쿼리,JSON/NoSQL과 관계형 데이터를 함께 사용 2. Python과 MySQL의 연동하면 좋은 점- python을 통해 데이터를 가져와 복잡한 데이..
1. 크롤링이란?- 웹에서 정보를 수집하는 기술- 쇼핑몰의 가격 정보를 크롤링하여 경쟁사 분석, 뉴스 기사나 학술 정보를 크롤링하여 데이터 분석 등에 사용 2. 사용법- 무한 스크롤의 경우 구글 크롬 검사(개발자모드) > Network 탭을 열고, 스크롤을 내린뒤 나오는 글 중 특정 글자를 filter에서 검색하고 클릭한다. 그 다음 header 탭을 클릭하면 Request URL:에 URL주소를 알려준다. 해당 url로 get요청을 하면 selenium으로 스크롤을 내리거나 할 필요 없이 json이나 beautifulsoup로도 간단하게 크롤링을 할 수 있다. 1) 데이터가 json 형식으로 생긴 경우import requestsimport jsonpage = requests.get("크롤링 하고 싶은..
1. 라이브러리 확인- 제공된 라이브러리(63개)만 사용할 수 있으며, 시험 중 추가 설치 불가- beautifulsoup4, selenium도 있었지만 requests가 없는거 보니 크롤링 문제는 안나올 것 같다. # 데이터프레임, 연산 기본pandasnumpy# 시각화(EDA)matplotlibseaborn# 통계, 모델링scipystatsmodelsscikit-learnxgboostlightgbm- 이름/사용법이 생각 안날 때: help, dirfrom sklearn import ensemble# 모듈의 설명 출력(사용 예시 등)help(ensemble)# 모듈내 포함된 클래스/함수 탐색print(dir(ensemble)) # RandomForestClassifier, GradientBoostin..
※ 빅데이터 분석기사 실기 체험: 예제 풀어보기 https://dataq.goorm.io/exam/3/%EB%B9%85%EB%8D%B0%EC%9D%B4%ED%84%B0%EB%B6%84%EC%84%9D%EA%B8%B0%EC%82%AC-%EC%8B%A4%EA%B8%B0-%EC%B2%B4%ED%97%98/quiz/5 1. 타이타닉 데이터셋 다운로드: https://www.kaggle.com/c/titanic/ 2. 문제풀이1) Sex와 Survived 변수 간의 독립성 검정시 카이제곱 통계량은? (반올림하여 소수 셋째짜리 까지 계산)import pandas as pdimport numpy as np# 파일 불러오기df= pd.read_csv('train_titanic.csv')df.info()# 결측치 확인d..
1. 모델 구조(층) 생성: Sequentail 또는 FunctionAPI 1) Sequentail: 모델이 단순하고 순차적인 구조가 필요한 경우import tensorflow as tf# 1: Sequentailmodel = tf.keras.models.Sequentail([ tf.keras.layers.Dense(64, activation='relu', input_dim=8), # 첫번째 노드 tf.keras.layers.Dense(1, activation='sigmoid'), # 마지막 레이어는 항상 예측 결과(0과 1로 예측할거면 1)]) 2) FunctionAPI: 복잡한 구조(병렬/스킵, 연결, 다중 입력/출력)가 필요한 경우import tensorflow as tf# 2: FunctionA..
- Total
- Today
- Yesterday
- 갓생
- 미라클모닝
- 운동
- 실기
- Python
- 아침운동
- 오블완
- 영어회화
- 경제
- 다이어트
- 프로그래머스
- llm
- 습관
- opic
- 티스토리챌린지
- 고득점 Kit
- 뉴스
- 30분
- C언어
- 스크랩
- IH
- 루틴
- Ai
- 빅데이터 분석기사
- ChatGPT
- 기초
- SQL
- 오픽
- 아침
- 줄넘기
일 | 월 | 화 | 수 | 목 | 금 | 토 |
---|---|---|---|---|---|---|
1 | 2 | 3 | 4 | |||
5 | 6 | 7 | 8 | 9 | 10 | 11 |
12 | 13 | 14 | 15 | 16 | 17 | 18 |
19 | 20 | 21 | 22 | 23 | 24 | 25 |
26 | 27 | 28 | 29 | 30 | 31 |