您好,登錄后才能下訂單哦!
本篇文章為大家展示了大數據中怎樣解決各種序列化導致的錯誤,內容簡明扼要并且容易理解,絕對能使你眼前一亮,通過這篇文章的詳細介紹希望你能有所收獲。
你會看到什么樣的序列化導致的報錯?
用client模式去提交spark作業,觀察本地打印出來的log。如果出現了類似于Serializable、Serialize等等字眼,報錯的log,那么恭喜大家,就碰到了序列化問題導致的報錯。雖然是報錯,但是序列化報錯,應該是屬于比較簡單的了,很好處理。
序列化報錯要注意的點:
你的算子函數里面,如果使用到了外部的自定義類型的變量,那么此時,就要求你的自定義類型,必須是可序列化的。
final Teacher teacher = new Teacher("SET"); studentsRDD.foreach(new VoidFunction() { public void call(Row row) throws Exception { String teacherName = teacher.getName(); .... } }); public class Teacher implements Serializable { }
如果要將自定義的類型,作為RDD的元素類型,那么自定義的類型也必須是可以序列化的
JavaPairRDD<Integer, Teacher> teacherRDD JavaPairRDD<Integer, Student> studentRDD studentRDD.join(teacherRDD) public class Teacher implements Serializable { } public class Student implements Serializable { }
上述內容就是大數據中怎樣解決各種序列化導致的錯誤,你們學到知識或技能了嗎?如果還想學到更多技能或者豐富自己的知識儲備,歡迎關注億速云行業資訊頻道。
免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。