Category: R

  • 기본적으로 다음의 웹페이지에서 내용을 참고했다.

    https://blog.pabii.co/wordcloud-r/

    library(tm)
    library(SnowballC)
    library(wordcloud)
    library(RColorBrewer)
    A = read.csv("~/R/1.csv", stringsAsFactors = F)
    
    A = Corpus(VectorSource(A))
    B = tm_map(A, PlainTextDocument)
    
    B = tm_map(B, content_transformer(tolower))
    B = tm_map(B, removePunctuation)
    B = tm_map(B, removeWords, stopwords('english'))
    B = tm_map(B, removeNumbers)
    excludes = c("with", "for", "were", "and", "was", "may", "performed", "high", "this", "the", "using", "cases", "can", "showed", "methods", "The", "results", "case", "similar", "revealed")
    B = tm_map(B, removeWords, excludes)
    # B = tm_map(B, stemDocument)
    wordcloud(B, random.order = F, colors = brewer.pal(8, "Dark2"), rot.per = 0.1, max.words = 100)

    Stemming 과정에서 단어가 짤리는게 꽤 나온다.

  • Logistic

    어제 들은 R 통계강좌가 유익해서 기록으로 남김.

    로지스틱의 의미는 모른다고 할지라도 로지스틱 회귀 분석을 해야할 경우가 있다. 이변량 자료에 대한 로지스틱 회귀분석은 분류(classification) 문제이기 때문에 실제로 같은 취급을 받는다고 한다.

    선형회귀분석은 lm() 함수를 이용하지만, 로지스틱 회귀분석은 glm()을 이용한다. 그 중에서 이변량 자료를 분석하기 위해서는 glm(   , family = binomial) 을 이용하면 된다.

    모델 최적화를 위해서는 step(   ) 을 95% 신뢰 구간의 오즈를 구하기 위해서는 confint(   )를, 오즈비를 구하기 위해서는 exp(confint(   )) 을 이용한다.

    나이가 1살 증가할 때마다 오즈가 변하는 것을 a라고 한다면, 10살 증가할 때의 오즈비는 exp(10*a)가 된다고 함.

    나머지 변수를 모두 포함시키는 분석을 위해서는 glm (  ~. ) 이렇게 물결표시 다음에 ‘.’ 을 입력하면 된다.

    분석 변수가 지나치게 많아서 오류가 난다면, glm(   ,maxit =    ) 에서 큰 숫자를 입력해준다.

  • ordinal regression analysis

    예전에 R에서 ordinal regression analysis 결과를 SPSS 처럼 만들어내지 못해서 SPSS이용하여 통계 분석을 하였다. 이번 리비젼 과정에서 SPSS를 사용할 수 없었기 때문에 R에서 ordinal regression analysis를 시도할 수 밖에 없었고, 인터넷을 통하여 거의 같은 결과를 만들어내는데 성공하였다.

    우선 MASS패키지를 사용한다. 이 패키지에 포함되어 있는 polr() 함수가 기본적으로 ordinal regression analysis  에 사용하는 함수이다.

    AER 패키지를 사용한다. coef()를 통하여 hazard ratio 를 구할 수 있다. coefci()를 통하여 95% 신뢰 구간을 구할 수 있다. coeftest()를 통하여 p.value를 구할 수 있다.

     

  • Kaplan-Meier analysis에서 pairwise 비교

    그 동안 KM 분석에서 pairwise 비교 하는 것을 찾을 수 없어서 SPSS를 이용하곤 했다. 인터넷 서핑을 하다가 오늘 R 패키지를 찾았다.

    “survminer” 패키지의 “pairwise_survdiff”를 이용하면 되며, 사용법은 survdiff와 동일하다.