기본 콘텐츠로 건너뛰기

데이터 가공 및 분석 - dplyr 패키지 (2)




 계속해서 dplyr 패키지를 이용한 데이터 가공에 대해서 이야기해 보겠습니다. subset과 다른 dplyr의 추가 기능 중 하나는 변수를 가공해서 새로운 변수를 만들 수 있다는 것입니다. 예를 들어 몸무게와 키를 이용해 체질량 지수 (BMI)를 계산하거나 혹은 달러 표시와 원화 표시를 동시에 할 수 있습니다. mutate 기능을 사용한 것으로 여기서는 1달러당 1100원으로 원화를 표시해 보겠습니다. mutate(price_kr=price*1100)%>%의 문법으로 앞에서 봤던 사용법과 크게 다르지 않습니다. 


D1%>%
  filter(cut=="Ideal")%>%  #Ideal 추출 
  select(carat,cut,color,clarity,price)%>% # 캐럿, 컷, 칼러, 채도, 가격 추출
  mutate(price_kr=price*1100)%>% #원화표시 가격
  arrange(carat) #오름차순 정렬

> D1%>%
+   filter(cut=="Ideal")%>%  #Ideal 추출 
+   select(carat,cut,color,clarity,price)%>% # 캐럿, 컷, 칼러, 채도, 가격 추출
+   mutate(price_kr=price*1100)%>% #원화표시 가격
+   arrange(carat) #오름차순 정렬
# A tibble: 18 x 6
   carat cut   color clarity price price_kr
          
 1  0.3  Ideal F     VS1       570   627000
 2  0.31 Ideal H     IF        772   849200
 3  0.31 Ideal D     VS2       942  1036200
 4  0.32 Ideal E     VVS1     1020  1122000
 5  0.33 Ideal G     IF        946  1040600
 6  0.33 Ideal H     VVS1      713   784300
 7  0.41 Ideal J     VS1       648   712800
 8  0.44 Ideal G     SI1       772   849200
 9  0.54 Ideal D     VS2      1993  2192300
10  0.6  Ideal F     VS1      2142  2356200
11  0.62 Ideal H     VS1      1808  1988800
12  0.7  Ideal F     SI1      2573  2830300
13  0.74 Ideal D     VS2      3858  4243800
14  1.01 Ideal D     SI2      5206  5726600
15  1.09 Ideal G     VVS2     8970  9867000
16  1.09 Ideal J     SI2      5034  5537400
17  1.11 Ideal F     VS2      9057  9962700
18  1.2  Ideal I     VS2      5699  6268900


 단순 계산 뿐 아니라 범주형 자료로 만들 수 있습니다. ifelse를 사용해 100만원을 기준으로 high와 low 그룹으로 나눠보겠습니다. mutate(price_group=ifelse(price_kr>1000000,"high","low"))%>%를 추가하면 됩니다. 

D1%>%
  filter(cut=="Ideal")%>%  #Ideal 추출 
  select(carat,cut,color,clarity,price)%>% # 캐럿, 컷, 칼러, 채도, 가격 추출
  mutate(price_kr=price*1100)%>% #원화표시 가격
  mutate(price_group=ifelse(price_kr>1000000,"high","low"))%>% #가격분류
  arrange(carat) #오름차순 정렬

> D1%>%
+   filter(cut=="Ideal")%>%  #Ideal 추출 
+   select(carat,cut,color,clarity,price)%>% # 캐럿, 컷, 칼러, 채도, 가격 추출
+   mutate(price_kr=price*1100)%>% #원화표시 가격
+   mutate(price_group=ifelse(price_kr>1000000,"high","low"))%>% #가격분류
+   arrange(carat) #오름차순 정렬
# A tibble: 18 x 7
   carat cut   color clarity price price_kr price_group
                 
 1  0.3  Ideal F     VS1       570   627000 low        
 2  0.31 Ideal H     IF        772   849200 low        
 3  0.31 Ideal D     VS2       942  1036200 high       
 4  0.32 Ideal E     VVS1     1020  1122000 high       
 5  0.33 Ideal G     IF        946  1040600 high       
 6  0.33 Ideal H     VVS1      713   784300 low        
 7  0.41 Ideal J     VS1       648   712800 low        
 8  0.44 Ideal G     SI1       772   849200 low        
 9  0.54 Ideal D     VS2      1993  2192300 high       
10  0.6  Ideal F     VS1      2142  2356200 high       
11  0.62 Ideal H     VS1      1808  1988800 high       
12  0.7  Ideal F     SI1      2573  2830300 high       
13  0.74 Ideal D     VS2      3858  4243800 high       
14  1.01 Ideal D     SI2      5206  5726600 high       
15  1.09 Ideal G     VVS2     8970  9867000 high       
16  1.09 Ideal J     SI2      5034  5537400 high       
17  1.11 Ideal F     VS2      9057  9962700 high       
18  1.2  Ideal I     VS2      5699  6268900 high       


 dplyr를 통해 데이터를 쉽게 추출하고 가공할 수 있다는 점은 큰 매력이라고 하겠습니다. 물론 이렇게 가공한 내용은 데이터프레임 이름<- csv="" nbsp="" span="">


 또 다른 중요한 기능은 그룹별 통계를 내서 새로운 데이터 프레임으로 만들 수 있는 기능입니다. group_by()와 summarise()를 통해 그룹별로 분류하고 평균이나 표준 편차 등 중요한 기본 통계량을 계산할 수 있습니다. 여기서는 cut 그룹별로 분류하고 가격을 알아보겠습니다. 


D1%>%
  select(carat,cut,color,clarity,price)%>% # 캐럿, 컷, 칼러, 채도, 가격 추출
  group_by(cut)%>% #cut 그룹별 분류 
  summarise(cut_price=mean(price)) #그룹별 평균 가격 

> D1%>%
+   select(carat,cut,color,clarity,price)%>% # 캐럿, 컷, 칼러, 채도, 가격 추출
+   group_by(cut)%>% #cut 그룹별 분류 
+   summarise(cut_price=mean(price)) #그룹별 평균 가격
# A tibble: 5 x 2
  cut       cut_price
           
1 Fair          3608 
2 Good          3850.
3 Very Good     4586 
4 Premium       6083.
5 Ideal         2929.

 의외로 프리미엄보다 아이디얼의 가격이 낮습니다. 아마도 캐럿 등 다른 요인이 있을 것 같은데 같이 표시해보겠습니다. summarise는 줄을 바꿔서 계속해서 명령을 추가할 수 있습니다. 

D1%>%
  select(carat,cut,color,clarity,price)%>% # 캐럿, 컷, 칼러, 채도, 가격 추출
  group_by(cut)%>% #cut 그룹별 분류 
  summarise(cut_price=mean(price),
            cut_carat=mean(carat)) #그룹별 평균 가격 및 캐럿 

> D1%>%
+   select(carat,cut,color,clarity,price)%>% # 캐럿, 컷, 칼러, 채도, 가격 추출
+   group_by(cut)%>% #cut 그룹별 분류 
+   summarise(cut_price=mean(price),
+             cut_carat=mean(carat)) #그룹별 평균 가격 및 캐럿
# A tibble: 5 x 3
  cut       cut_price cut_carat
                
1 Fair          3608      0.87 
2 Good          3850.     0.767
3 Very Good     4586      0.895
4 Premium       6083.     1.19 
5 Ideal         2929.     0.636


 역시 그런 결과가 나왔습니다. Ideal이 캐럿이 작습니다. 이에 여기에 각 값별로 숫자가 얼마나 되는지 알아보겠습니다. N=n()을 이용하면 됩니다. 


> D1%>%
+   select(carat,cut,color,clarity,price)%>% # 캐럿, 컷, 칼러, 채도, 가격 추출
+   group_by(cut)%>% #cut 그룹별 분류 
+   summarise(cut_price=mean(price),
+             cut_carat=mean(carat),
+             N=n()) #그룹별 평균 비교
# A tibble: 5 x 4
  cut       cut_price cut_carat     N
                
1 Fair          3608      0.87      2
2 Good          3850.     0.767     9
3 Very Good     4586      0.895    11
4 Premium       6083.     1.19     10
5 Ideal         2929.     0.636    18


이렇게 얻은 통계 데이터를 D3라는 새로운 데이터 프레임으로 만들어보겠습니다. 


D3<-d1>%
  select(carat,cut,color,clarity,price)%>% # 캐럿, 컷, 칼러, 채도, 가격 추출
  group_by(cut)%>% #cut 그룹별 분류 
  summarise(cut_price=mean(price),
            cut_carat=mean(carat),
            N=n()) #그룹별 평균 비교 

D3

> D3<-d1>%
+   select(carat,cut,color,clarity,price)%>% # 캐럿, 컷, 칼러, 채도, 가격 추출
+   group_by(cut)%>% #cut 그룹별 분류 
+   summarise(cut_price=mean(price),
+             cut_carat=mean(carat),
+             N=n()) #그룹별 평균 비교 
> D3
# A tibble: 5 x 4
  cut       cut_price cut_carat     N
                
1 Fair          3608      0.87      2
2 Good          3850.     0.767     9
3 Very Good     4586      0.895    11
4 Premium       6083.     1.19     10
5 Ideal         2929.     0.636    18


 앞서 소개한 aggregate 역시 데이터 분석에서 유용하게 쓰일 수 있지만, 이렇게 데이터 프레임으로 저장하기는 어렵습니다. dplyr의 유용성이 여기서 드러납니다. 


이제 마지막으로 diamonds 데이터 전체에 대해서도 비슷한 결과가 나오는지 알아보겠습니다. 표준편차까지 추가해서 알아보겠습니다. 

diamonds%>%
  select(carat,cut,color,clarity,price)%>% # 캐럿, 컷, 칼러, 채도, 가격 추출
  group_by(cut)%>% #cut 그룹별 분류 
  summarise(cut_price=mean(price),
            cut_carat=mean(carat),
            N=n()) #그룹별 평균 비교 

> diamonds%>%
+   select(carat,cut,color,clarity,price)%>% # 캐럿, 컷, 칼러, 채도, 가격 추출
+   group_by(cut)%>% #cut 그룹별 분류 
+   summarise(cut_price=mean(price),
+             cut_carat=mean(carat),
+             N=n()) #그룹별 평균 비교
# A tibble: 5 x 4
  cut       cut_price cut_carat     N
                
1 Fair          4359.     1.05   1610
2 Good          3929.     0.849  4906
3 Very Good     3982.     0.806 12082
4 Premium       4584.     0.892 13791
5 Ideal         3458.     0.703 21551


 전체 결과를 보니 표본이 전체 경향을 대표하기는 하지만 약간은 다르다는 점을 알 수 있습니다. 아무튼 각 그룹별 통계를 비롯한 여러 가지 데이터를 dplyr로 확인하고 저장할 수 있다는 점이 큰 매력이라고 할 수 있습니다. 다음에는 데이터 가공 및 정리에서 매우 중요한 데이터 합치기에 대해서 설명해 보겠습니다. 

댓글

이 블로그의 인기 게시물

100 테슬라급 자기장 도달

 미국의 로스 알라모스 국립 연구소 (Los Alamos National Laboratory) 에서 과학자들이 지금까지 인간이 개발한 가장 강력한 자기장을 발생시키는 장치 개발에 도전하고 있습니다. 자기장의 세기를 나타내는 방법으로 자기력선의 밀도를 나타내기 위해 단위 면적당 자기력선의 수를 표시하는 단위인 테슬라 (T) 가 있습니다. (1T = 1Wb/㎡  웨버 (Wb) 는 자속의 단위)   의료용으로 사용되는 초전도체를 이용한 MRI 의 경우 1.5 - 3 테슬라급의 강력한 자기장으로 인체 내부를 볼 수 있게 만들지만 과학 연구용으로 이보다 더 강력한 자기장이 필요할 수 있습니다. 최근에 등장한 90 테슬라급 자기장에 이어 이번에 로스 알라모스 국립 연구소에서는 100 테슬라급인 100.75 T 를 실현 했다고 합니다.   이를 구현한 것은 18000 파운드 (8.16 톤 정도) 의 코일과 여기에 에너지를 공급할 1200 메가줄 (Megajoule) 급 모터 제네레이터등의 설비입니다.  (   The 1,200-megajoule motor generator that powers the magnetic pulse.  )  이와 같은 연구를 통해 알아내고자 하는 것은  Quantum Phase transitions and new ultra high field magnetic states Electronic Structure determination Topologically protected states of matter  로 요약할 수 있다고 합니다.   아무튼 수 T 급 MRI 만 해도 자기장의 힘이 엄청난데 100 T 라니 엄청난 자기장이네요. 이는 지구 자기장 세기보다 200만배 강력한 (물론 좁은 범위에서 작용하는 자기장이라 지구 전체...

고대 양서류 이야기 (2) - 악어를 닮은 거대 양서류들

  페름기에는 다양한 양막류가 진화해서 앞서 소개한 육상형 템노스폰딜리는 점차 설 자리를 잃게 됩니다. 하지만 양서류는 본래 자신의 서식지인 물과 습지에서 여전히 번성을 누렸습니다. 당시에는 악어류 같은 대형 양서형 파충류도 없던 시절이었기 때문에 이와 비슷한 생태학적 지위는 여전히 양서류의 몫이었습니다. 이들에 대한 이야기는 제 책인 포식자에서 비교적 간단히 다뤘는데, 오늘은 여기에 대한 보충 설명입니다.  책 정보:  http://book.naver.com/bookdb/book_detail.nhn?bid=13347200 Yes 24:  http://www.yes24.com/24/goods/58772859 11번가:  http://books.11st.co.kr/product/SellerProductDetail.tmall?method=getSellerProductDetail&prdNo=1977867160 알라딘:  http://www.aladin.co.kr/shop/wproduct.aspx?ItemId=134877825 교보문고:  http://www.kyobobook.co.kr/product/detailViewKor.laf?ejkGb=KOR&mallGb=KOR&barcode=9788970447988&orderClick=LAG&Kc= 인터파크 :  http://book.interpark.com/product/BookDisplay.do?_method=detail&sc.prdNo=279593764&sc.saNo=003002003&bid1=search_auto&bid2=detail&bid3=prd_img&bid4=001 영풍문고:  http://www.ypbooks.co.kr/book.yp?bookcd=100843205&gubun=NV ...

이빨이 다시 진화한 개구리

  ( CT scans of Gastrotheca guentheri skulls revealed what appeared to be identical rows of teeth on both the upper and lower jaws, which researchers later confirmed through dissection. Credit: Florida Museum/Daniel Paluh )  개구리는 2억년 전 진화 과정에서 이빨을 잃어버리고 큰 턱과 혀를 이용해 곤충 같은 작은 먹이를 잡아 먹는 방향으로 진화했습니다. 파충류나 포유류 같은 다른 사지류와의 경쟁에서 밀려 양서류가 쇠퇴하고 멸종하던 시기에도 개구리는 여전히 생존할 수 있었던 비결입니다.   이빨이 없는 덕분에 큰 혀를 발사하기 편해졌을지는 모르지만, 이빨이 없으면 종종 불편할 때가 있습니다. 씹는 대신 삼키기 때문에 음식을 씹을 수 없다는 점은 문제되지 않지만, 필사적으로 달아나려는 먹이를 잡기 힘들기 때문입니다. 이런 이유 때문에 일부 개구리는 이빨 같이 보이는 엄니 (fang)을 지니고 있으나 이는 사라진 이빨이 다시 난 것이 아니라 다른 부분이 진화한 것입니다.   이는 돌로의 법칙 ( Dollo's Law )으로 알려져 있습니다. 진화 과정에서 퇴화한 부분이 다시 생겨나지 않으며 대신 필요하면 다른 부분이 진화해 그 역할을 대신한다는 것입니다. 예를 들어 아가미가 사라진 사지 동물은 다시 물에 들어온다고 해도 아가미가 다시 생기진 않습니다. 대신 고래처럼 폐가 커져서 그 기능을 대신하게 됩니다.   하지만 모든 법칙엔 예외가 있기 마련입니다. 남미에서 발견된 멸종 위기 개구리 중 하나인 구엔터 유대류 개구리 ( Gastrotheca guentheri, Guenther's marsupial frog, dentate marsupial frog)는 완전한 형태의 이빨을 지니고 있습니다. 참고로 유대류 개구리라는 명칭은...