Bigdata, Hadoop ecosystem, Semantic IoT등의 프로젝트를 진행중에 습득한 내용을 정리하는 곳입니다.
필요한 분을 위해서 공개하고 있습니다. 문의사항은 gooper@gooper.com로 메일을 보내주세요.

[Elephas] Jena Elephas를 이용하여 Spark에서 rdfTriples의 RDD를 만들고 RDD관련 작업하는 샘플소스

총관리자 2016.08.10 11:17 조회 수 : 90

1. 테스트용 triple rdf 파일인 test.ttl파일을 준비한다.

2. HDFS에 저장한다 : hadoop fs -put test.ttl

3. spark-submit을 이용하여 Spark Application을 실행한다.

: $HOME/spark/bin/spark-submit --master spark://sda1:7077,sda2:7077 --deploy-mode client --class ElephasTestBySpark --jars icbms-assembly-2.0.jar icbms-assembly-2.0.jar test.ttl

---------build.sbt(일부분) -----------

//elephas

("org.apache.jena" % "jena-elephas-common" % "3.1.0"),

("org.apache.jena" % "jena-elephas-io" % "3.1.0"),

("org.apache.jena" % "jena-elephas-mapreduce" % "3.1.0"),

// hadoop

("org.apache.hadoop" % "hadoop-common" % "2.7.2" % "provided"),

("org.apache.hadoop" % "hadoop-mapreduce-client-common" % "2.7.2" % "provided")

-------------------------ElephasTestBySpark.scala---------------------

import org.apache.spark.SparkConf

import org.apache.spark.SparkContext

import org.apache.jena.hadoop.rdf.io.input.TriplesInputFormat

import org.apache.hadoop.io.LongWritable

import org.apache.jena.hadoop.rdf.types.TripleWritable

import org.apache.hadoop.conf.Configuration

object ElephasTestBySpark{

def main(args: Array[String]) = {

val conf = new SparkConf()

.setAppName("ElephasTestBySpark")

val sc = new SparkContext(conf)

val hadoopConf = new Configuration()

val rdfTriples = sc.newAPIHadoopFile(args(0).toString(),

classOf[TriplesInputFormat],

classOf[LongWritable],

classOf[TripleWritable],

hadoopConf)

System.out.println("take 10 start-------------------");

rdfTriples.take(10).foreach(println)

System.out.println("take 10 end-------------------");

System.out.println("countByKey start-------------------");

rdfTriples.countByKey().foreach(println)

System.out.println("countByKey end-------------------");

}

이 게시물을

번호	제목	글쓴이	날짜	조회 수
501	DataSetCreator실행시 "Illegal character in fragment at index"오류가 나는 경우 조치방안	총관리자	2016.06.17	481
500	시스템날짜를 현재 정보로 동기화 하는 방법(rdate, ntpdate이용)	총관리자	2014.08.24	481
499	Cannot create /var/run/oozie/oozie.pid: Directory nonexistent오류	총관리자	2014.06.03	479
498	java.util.NoSuchElementException발생시 조치	총관리자	2014.08.27	477
497	Ubuntu 16.04 LTS에 Hive 2.1.1설치하면서 "Version information not found in metastore"발생하는 오류원인및 조치사항	총관리자	2017.05.03	475
496	java.lang.OutOfMemoryError: unable to create new native thread오류 발생지 조치사항	총관리자	2016.10.17	474
495	spark-sql실행시 The specified datastore driver ("com.mysql.jdbc.Driver") was not found in the CLASSPATH오류 발생시 조치사항	총관리자	2016.06.09	467
494	servlet-api를 jar형태로 build할때 포함하지 말고 java 설치 위치의 jre/lib/ext에 복사하여 사용하는것이 좋다.	총관리자	2016.08.10	460
493	Spark 1.6.1 설치후 HA구성	총관리자	2016.05.24	455
492	java.lang.IllegalArgumentException: Does not contain a valid host:port authority: master 오류해결방법	총관리자	2015.05.06	453
491	CDH 5.14.2 설치중 agent설치에서 실패하는 경우 확인/조치	총관리자	2018.05.22	451
490	Elastic Search For Hadoop 2.2.0설치하기(5대 클러스터링)	총관리자	2016.04.04	449
489	Drools 6.0 - 비즈니스 룰 기반으로 간단한 룰 애플리케이션 만들기	총관리자	2016.07.18	445
488	Java 8에서 pom.xml에 JavaDoc 관련 태그가 설정되어 있으나 오류등으로 실패하면 나머지 Maven작업이 종료되는 문제 해결 방법	총관리자	2017.01.24	441
487	[번역] solr 검색 엔진 튜토리얼	총관리자	2014.10.07	441
486	db를 통째로 새로운 이름의 db로 복사하는 방법/절차	총관리자	2017.11.14	438
485	Could not configure server becase SASL configuration did not allow the Zookeeper server to authenticate itself properly: javax.security.auth.login.LoginException: Checksum failed	총관리자	2019.05.18	435
484	CDP에서 AD와 Kerberos를 활용하여 인증 환경을 구축하는 3가지 방법	gooper	2022.06.10	433
483	elasticsearch 기동시 permission denied on key 'vm.max_map_count' 오류발생시 조치사항	총관리자	2017.06.23	431
482	ontology, jena, sparql등 전반에 대한 설명및 예제를 제공하는 사이트	총관리자	2015.12.08	428

쓰기 태그

첫 페이지 8 9 10 11 12 13 14 15 16 17 끝 페이지

A personal place to organize information learned during the development of such Hadoop, Hive, Hbase, Semantic IoT, etc.
We are open to the required minutes. Please send inquiries to gooper@gooper.com.

Bigdata, Semantic IoT, Hadoop, NoSQL

Bigdata, Hadoop ecosystem, Semantic IoT등의 프로젝트를 진행중에 습득한 내용을 정리하는 곳입니다.
필요한 분을 위해서 공개하고 있습니다. 문의사항은 gooper@gooper.com로 메일을 보내주세요.

fuseki/jena/ [Elephas] Jena Elephas를 이용하여 Spark에서 rdfTriples의 RDD를 만들고 RDD관련 작업하는 샘플소스

댓글 0

A personal place to organize information learned during the development of such Hadoop, Hive, Hbase, Semantic IoT, etc.
We are open to the required minutes. Please send inquiries to gooper@gooper.com.

Bigdata, Semantic IoT, Hadoop, NoSQL

Bigdata, Hadoop ecosystem, Semantic IoT등의 프로젝트를 진행중에 습득한 내용을 정리하는 곳입니다. 필요한 분을 위해서 공개하고 있습니다. 문의사항은 gooper@gooper.com로 메일을 보내주세요.

fuseki/jena/ [Elephas] Jena Elephas를 이용하여 Spark에서 rdfTriples의 RDD를 만들고 RDD관련 작업하는 샘플소스

댓글 0

A personal place to organize information learned during the development of such Hadoop, Hive, Hbase, Semantic IoT, etc. We are open to the required minutes. Please send inquiries to gooper@gooper.com.

LOGIN

Bigdata, Hadoop ecosystem, Semantic IoT등의 프로젝트를 진행중에 습득한 내용을 정리하는 곳입니다.
필요한 분을 위해서 공개하고 있습니다. 문의사항은 gooper@gooper.com로 메일을 보내주세요.

A personal place to organize information learned during the development of such Hadoop, Hive, Hbase, Semantic IoT, etc.
We are open to the required minutes. Please send inquiries to gooper@gooper.com.