2026/06/25 THU |
|
| △ | ● |
| O | ● |
⊙ 식스시그마 시험
결과론적으로 식스시그마 합격했다
근데,,, 자격증 발급 비용이 이게 맞나? 싶어 발급은 보류 중이다
일주일 정도 시간이 주어졌으니 다른 자격증 공부하면서 생각을 해봐야겠다,,, 있으면 괜찮은 자격증인지에 대해
그래서 오늘 계획은 발급까지 였으나 발급까지 마무리하지 못해 △
⊙ 최종 프로젝트 - 데이터 전처리
| <2026/06/23 최종 프로젝트 시작> ● 제약, 바이오 분야에서 시계열 특성을 가진 데이터를 활용하는게 어떻겠냐는 의견이 모아졌다. 후보 1. 콜레스테롤 저하제 제조 및 품질 데이터 후보 3. IndPenSim, 페니실린 발효 시스템
https://www.kaggle.com/datasets/stephengoldie/big-databiopharmaceutical-manufacturing |
| <2026/06/24 최종 프로젝트 Day +02> ● 제약, 바이오 분야 공정 + 시계열 데이터를 찾기 쉽지 않았다. ● 공정 순서, 시스템적 요소는 없지만 다양한 컬럼이 존재해 분석 과정에서 많은 인사이트를 얻을 수 있을 것 같은 "후보 2. FDA 의약품 부작용 보고서"로 데이터 선정을 마무리하였다 ● 이 데이터의 단점?은 목적값?이 없다는 것이다. 여태까지 프로젝트를 진행하며 그러나 이번에는 그 목적이 뚜렷하게 없다는 것이다 이전 프로젝트는 목적 지향적 그러니까 Top Down Approach 였다면 (하향식 분석 : 문제 탐색 - 문제 정의 - 해결방안 탐색 - 타당성 검토) 이번 프로젝트는 해본적 없는 데이터 지향적 방식, Botton Up Approach(상향식 분석 : 가설 수립 - 설계 - 실험 - 테스트(평가) 및 문제정) |
| <2026/06/25 최종 프로젝트 Day +03> ● (528000, 30) → 방대한 데이터,,, 컬럼만 30개, 528,000행... 11년이라는 기간을 생각하면 평이한건가? |
FAERS 데이터 파악 및 전처리
더보기
⊙ 데이터 파악
| ○ 2015년 1월 ~ 2025년 12월 : 11년간 FDA에 보고된 약물 보고서 : 528,000 row X 30 column |
|
○ 컬럼
|
⊙ 데이터 전처리
![]() |
![]() |
| ○ .info() | issnull().sum() 무슨 일이죠? | |
![]() ○ 컬럼은 왜 중간에 잘리는 거죠? # 생략되는 부분 없이 다 볼 수 있게 설정
pd.set_option('display.max_columns', None)
# (선택 사항) 컬럼 안의 내용이 길어서 잘릴 경우, 아래 설정도 추가
# pd.set_option('display.max_colwidth', None)
# 다시 확인
df.head(10)
![]() ○ 생략된 컬럼없이 볼 수 있게 됨 |
|
| 1. report_id : FDA 고유 식별자 를 통해 얻을 정보 있을까? → 1. 제거 | |
| 2. receive_date에 3. year + 4. month + 5. quarter의 내용이 있으므로 → 3. 4. 5. 제거 | |
![]() ○ seriouse_flags의 값 Array(배열)을 살펴보면 'is_' 컬럼들과 중복? 겹치는 내용이므로 'is_' 컬럼에 없는 Congenital Anomaly(선천적 기형)을 'is_Anomaly' 컬럼으로 생성하고 → 7. 'seriouse_flags' 제거 |
|
| ○ 12. reactions 컬럼의 첫번째 부분이 13. primary_reaction이므로 중복되는 내용이어서 → 13. 제거 |
|
| ○ 21. manufacturer : 해당 의약품 만든 제조사 부작용 판단과 관계 없으므로 (우리가 목표?로 하는 웹페이지의 구상안에도 전혀 필요없으므로) → 21. 제거 |
|
| ○ 25. patient_age_years 와 26. age_group 중복되는 내용으로 → 26. 제거 |
|
| ○ 30. report_age_days : 2026년 기준 보고서 접수 후 경과 일수 는 이미 보고서 날짜가 있으므로 → 30. 제거 |
|
|
|
![]() ![]() ○ 중복 행 제거 |
|
⊙ 이후 데이터 전처리 계획
| ○ pharm_class : FDA 분류 컬럼 제거/유지에 대한 논의 ○ unknown 표시 데이터 결측값을 → np.nan으로 변경에 대한 논의 |
'★ 최종 프로젝트 - FDA 이상반응 데이터 활용한★' 카테고리의 다른 글
| [QA/QC - 5기] 81일차 - 최종 프로젝트 +08 : 전처리 - 한국OTC vs FDA OTC (1) | 2026.07.02 |
|---|---|
| [QA/QC - 5기] 80일차 - 최종 프로젝트 +07 : 일반의약품(OTC) (0) | 2026.07.01 |
| [QA/QC - 5기] 79일차 - 최종 프로젝트 +06 : 목표 구체화 / 크롤링 (0) | 2026.07.01 |
| [QA/QC - 5기] 78일차 - 최종 프로젝트 +05 : 목적 구체화 (1) | 2026.06.29 |
| [QA/QC - 5기] 77일차 - 최종 프로젝트 +04 : MCAR,MAR,MNAR / 목적 구체화 (0) | 2026.06.26 |






