1. 라이브러리 확인- 제공된 라이브러리(63개)만 사용할 수 있으며, 시험 중 추가 설치 불가- beautifulsoup4, selenium도 있었지만 requests가 없는거 보니 크롤링 문제는 안나올 것 같다. # 데이터프레임, 연산 기본pandasnumpy# 시각화(EDA)matplotlibseaborn# 통계, 모델링scipystatsmodelsscikit-learnxgboostlightgbm- 이름/사용법이 생각 안날 때: help, dirfrom sklearn import ensemble# 모듈의 설명 출력(사용 예시 등)help(ensemble)# 모듈내 포함된 클래스/함수 탐색print(dir(ensemble)) # RandomForestClassifier, GradientBoostin..
※ 빅데이터 분석기사 실기 체험: 예제 풀어보기 https://dataq.goorm.io/exam/3/%EB%B9%85%EB%8D%B0%EC%9D%B4%ED%84%B0%EB%B6%84%EC%84%9D%EA%B8%B0%EC%82%AC-%EC%8B%A4%EA%B8%B0-%EC%B2%B4%ED%97%98/quiz/5 1. 타이타닉 데이터셋 다운로드: https://www.kaggle.com/c/titanic/ 2. 문제풀이1) Sex와 Survived 변수 간의 독립성 검정시 카이제곱 통계량은? (반올림하여 소수 셋째짜리 까지 계산)import pandas as pdimport numpy as np# 파일 불러오기df= pd.read_csv('train_titanic.csv')df.info()# 결측치 확인d..
1. 모델 구조(층) 생성: Sequentail 또는 FunctionAPI 1) Sequentail: 모델이 단순하고 순차적인 구조가 필요한 경우import tensorflow as tf# 1: Sequentailmodel = tf.keras.models.Sequentail([ tf.keras.layers.Dense(64, activation='relu', input_dim=8), # 첫번째 노드 tf.keras.layers.Dense(1, activation='sigmoid'), # 마지막 레이어는 항상 예측 결과(0과 1로 예측할거면 1)]) 2) FunctionAPI: 복잡한 구조(병렬/스킵, 연결, 다중 입력/출력)가 필요한 경우import tensorflow as tf# 2: FunctionA..
1. 신경망- Neural Network, 생물학적 뉴런의 동작을 모방하여 데이터 간의 관계를 학습- 뉴런의 기본 동작 - z를 활성화 함수에 전달하여 뉴런이 활성화될지 여부를 결정 1) 입력층(Input Layer)- 입력 데이터를 받아들이는 계층, 각 특징(feature)이 뉴런 하나에 대응- 이미지 데이터 64*64 크기의 입력층 뉴런 갯수 = 64*64- 활성화 함수는 사용하지 않는다 2) 은닉층(Hidden Layers)- 입력 데이터를 처리하고, 패턴이나 특징을 학습- 은닉층의 갯수와 뉴련 수는 문제의 복잡도에 따라 결정된다.- 하나 이상의 은닉층을 포함하며, 층이 많아질수록 딥러닝이 된다.- 활성화 함수 사용하여 복잡한 패턴을 학습: tanh, ReLU- 과적합 방지를 위해 규제(Regula..
1. 언제 검정이 필요할까?1) 그룹 간 평균 차이가 유의미한가? 그룹이 2개면 T-검정, 그룹이 3개이상이면 ANOVA- t-검정 또는 ANOVA 검정을 수행하기 전에, 독립성 > 정규성 > 등분산성 순으로 가정을 만족하는지 확인가정확인방법가정의 가정가정 만족하지 않는다면t-test, ANOVA 대신독립성- 연구설계(무작위 샘플링, 실험군-대조군)- 범주형: 카이제곱 검정- 잔차: Durbin-Watson, ACF 플롯- 군집: ICC- 시계열: Ljung-Box, ACF* 카이제곱 독립성 검정- 각 기대빈도 값 5 이상(5미만은 피셔의 정확검정)- 데이터 독립적으로 수집- Paired t-test- Mixed Effects Model정규성- 시각적: 히스토그램, Q-Q플롯- Shapiro-Wilk-..
1. 코랩 실행 2. 캐글 로그인 후, 설정>API>Create New Token 클릭> 다운로드 된 json파일 colab에 업로드 3. 캐글 data탭에서 다운로드 코드 복사- 예시 : 개, 고양이 데이터 셋 https://www.kaggle.com/competitions/dogs-vs-cats-redux-kernels-edition/data 4. 코랩에 해당 코드 입력 및 실행하여 다운로드 받기import osos.environ['KAGGLE_CONFIG_DIR'] = '/content/'!kaggle competitions download -c dogs-vs-cats-redux-kernels-edition 5. 파일 압축 해제!unzip -q dogs-vs-cats-redux-kernels-e..
1. Docker란?- 컨테이너 기반의 가상화 시스템, 실행 환경을 독립적으로 격리한 컨테이너- 모두가 동일한 개발환경을 사용할 수 있어 물리적 환경의 차이, 서버 구성의 차이를로 인한 문제점을 방지할 수 있다.- 한 대의 서버에 웹 서버를 여러개 설치도 가능하다.- 도커와 가상화 기술의 차이: 컨테이너는 운영체제의 일부 기능을 호스팅 컴퓨터에 의존- AWS EC2: 각각의 인스턴스가 완전히 독립된 컴퓨터처럼 동작한다.(가상화 기술)- AWS ECS: 별도로 가상 서버를 만들지 않아도 컨테이너 이미지를 그대로 실행할 수 있다. 2. 서버란?- 어떤 서비스를 제공하는 것(기능적 의미의 서버/물리적 컴퓨터로서의 서버)- 소프트웨어를 설치해 기능을 갖춘다* 예시- 웹 서버: 웹사이트 기능을 제공하는 서버- 데..
1. IQR 이상치 : quantile()import pandas as pddf = pd.read_csv('train.csv')df.info()# 1-1. age 컬럼의 3사분위수와 1사분위수의 차를 절대값으로 구하고, 소수점 버려서, 정수로 출력¶df['Age'].isna().sum()Q1 = df['Age'].quantile(0.25)Q3 = df['Age'].quantile(0.75)IQR = Q3-Q1print(int(abs(Q3-Q1)))#1-2. (loves반응+wows반응)/(reactions반응) 비율이 0.4보다 크고 0.5보다 작으면서, type 컬럼이 'video'인 데이터의 갯수 fb = pd.read_csv('fb.csv')fb.info()fb.head()fb.query('((lo..
- Total
- Today
- Yesterday
- IH
- 오블완
- 아침운동
- 운동
- 뉴스
- 티스토리챌린지
- 스크랩
- Python
- 영어회화
- 습관
- Ai
- 줄넘기
- ChatGPT
- 오픽
- 30분
- 경제
- 아침
- 실기
- llm
- opic
- 프로그래머스
- 고득점 Kit
- 빅데이터 분석기사
- 갓생
- 미라클모닝
- SQL
- 다이어트
- C언어
- 기초
- 루틴
일 | 월 | 화 | 수 | 목 | 금 | 토 |
---|---|---|---|---|---|---|
1 | 2 | 3 | 4 | |||
5 | 6 | 7 | 8 | 9 | 10 | 11 |
12 | 13 | 14 | 15 | 16 | 17 | 18 |
19 | 20 | 21 | 22 | 23 | 24 | 25 |
26 | 27 | 28 | 29 | 30 | 31 |