dataset1 [spark] RDD, DataFrame, DataSet 스파크의 RDD, DataFrame, DataSet의 차이에 대해서 RDD, DataFrame, DataSet RDD Spark 1.0에서 소개 Java, Scala의 객체를 처리 하는 방식으로 처리 가능 transformation 함수들을 제공하고 각 함수의 결과를 RDD로 생성 action 함수가 호출되어야 실제 동작 rdd.filter(.age >21).map(.last).saveAsObjectFile("result.txt") DataFrame Spark 1.3에서 프로젝트 텅스텐의 일부로 소개 데이터를 스키마 형태로 추상화 하여 처리 Catalyst 옵티마이저에 의해 효율적으로 처리 df.filter("age > 21") df.filter(df.col("age").gt(21)) DataSet 스파.. 2018. 3. 28. 이전 1 다음