Blog

  • 건강보험심사평가원 자료 활용

    오늘 아침에 심평원 자료 분석과 관련된 설명회에 다녀왔다.
    이 자료의 장점과 단점이 있지만

    첫 번째로 가장 중요한 문제.
    SAS를 사용할 줄 알아야 한다고 주장함. SAS Enterprise 를 꼭 사용해야 할 필요가 있는지는 심히 의문스러우나, R이 안될 것 같지는 않아보임. 한글과 같은 2byte 문자가 있으면 어쩌나 걱정했는데 물어본 결과 영어와 숫자의 조합으로만 구성되어 있다고 함. 일단은 SAS 능력자가 대우받게 될 것임. R을 사용하여도 큰 문제가 없다면 R도 괜찮을 것 같음. 내 생각엔 문제없음. 고사양의 컴퓨팅을 하기 때문에 SAS Enterprise 가 필요하다는 정도의 답변을 한 것을 보면 R도 전혀 문제 없을것으로 보여짐. R의 경우에는 패키지 설치도 제한될 것으로 보여짐. 하지만, 통상적으로 빈도분석을 하는 경우라면 기본 함수로도 충분할 것으로 판단됨.

    두 번째. Script 반입이 안됨.
    보안과 관리의 문제로 인하여 가상 OS 상에서 사용을 하는 것으로 추정됨. 외부에서 파일 반입이 절대로 쉽지 않은 구조로 되어 있음. 따라서, SAS과 R에서 공동의 문제로 Script 파일의 반입이 안됨. 그러니까 직접 컴퓨터에서 쳐 넣어야 한다는 의미임. 그 컴퓨터는 공용이기 때문에 미리 Script 구축이 필요한 것이 될 것임. 표본 자료를 바탕으로 미리 Script 를 짜놓고, 원자료에서 실행하는 것이 필요할 것으로 판단됨.

    세 번째. 자료 반출의 한계.
    당연한 결과일 수 있는데, 모두 다 가공이 된 자료만 반출이 가능하다고 생각해야 함. 원자료 반출은 포기하는게 이로우며, 개인정보 포함 여부를 심사한다고 함.

    일단 표본자료를 통하여 필요한 자료의 범위를 매우 구체적으로 지정하는 것이 필요함. 분석을 위한 Script 를 잘 설계해야 함.

    해볼 만한 내용인 것 같음.

  • 날짜, 시간 출력

    > format(Sys.time(), "%Y%m%d-%H%M%S")
    [1] "20141004-165820"

    파일로 결과물을 저장할 때에 있어서, 중복된 것인지 아닌지 혹은 언제 만들었는지 표현해야할 경우가 있다. 특히 짧은 시간에 여러개의 파일을 만들 경우에 중복되지 않은 이름을 생성하는 방법이 필요하다. 문자를 포함하는 난수를 이용해서 시도하는 방법도 있겠지만, 그것보다는 시각정보를 사용하는게 편하다. 0.001초 단위를 사용하지 않아도 충분히 다른 문자를 생성할 수가 있다.

    Sys.time() 으로 현재 날짜와 시간을 불러온 다음 format 명령어를 이용해서 원하는 형식으로 출력해서 사용하면 된다. 파일명에 띄어쓰기나 특수기호가 있으면 좀 곤란할 때가 있으므로, 위와 같은 식으로 하면 될 것 같다.

    > format(Sys.time(), "%S %OS6")
    [1] "21 21.499652"

    추가적으로 초를 표현할 때에 보통은 %S로 하겠지만, R에서는 %OSn(n; 1~6)를 사용하면 소숫점 단위의 초를 불러올 수 있다.

  • 린치핀

    린치핀

    이 책은 조금 애매하다. 다른 사람과 바꿀 수 없는 독특한 어떤 재능을 지녀야 한다는 이야기를 하고 있다. 기계나 컴퓨터 등으로 대체할 수 없는 독특한 재능, 이 책에서 표현하는 바로는 ‘예술’을 하는 것이 필요하다고 이야기하고 있다.

    표현은 간단하지만, 획일화된 사회에서 살고 있는 사람들에게는 굉장히 어려운 내용. 무턱대고 독특한 행동을 하지 말고, 자기가 할 수 있고 책임질 수 있는 범위부터 메뉴얼대로 처신하는게 아닌, 차별화된 행동을 하는 것을 권고하고 있다.