使用Python構(gòu)造hive insert語(yǔ)句說(shuō)明
mysql可以使用nevicat導(dǎo)出insert語(yǔ)句用于數(shù)據(jù)構(gòu)造,但是hive無(wú)法直接導(dǎo)出insert語(yǔ)句。我們可以先打印在hive命令行,然后使用腳本拼裝成insert語(yǔ)句,進(jìn)行數(shù)據(jù)構(gòu)造。
手動(dòng)copy到python腳本進(jìn)行sql語(yǔ)句構(gòu)造:
def transformString(s): list_s = s.split(’t’) print(len(list_s)) s_new = ’’ for item in list_s: s_new += ’'’ + item.strip(’ ’) + ’'’ + ’,’ return str(s_new.rstrip(’,’))# 為手動(dòng)copy hive命令行打印輸出的記錄s = '555 helloworld's_new = transformString(s)sql = ’insert into dw.test PARTITION (ymd = ’2019-03-18’) values({});’.format(s_new)print(sql)
結(jié)果:
insert into dw.test PARTITION (ymd = ’2019-03-18’) values('555','helloworld');
補(bǔ)充知識(shí):python向hive插入數(shù)據(jù)遇到的坑
因項(xiàng)目需求,應(yīng)用python建模需要通過(guò)hive取數(shù),并將結(jié)果寫(xiě)入hive表。
嘗試了以下幾條坑爹路,僅做記錄如下:
通過(guò)impyla庫(kù)搭建hive與python橋梁
1.1 環(huán)境配置的坑(回頭放連接)
注: 遠(yuǎn)程訪問(wèn)hive一定要記得配置賬號(hào)密碼!!!報(bào)錯(cuò):。。。-4.。。
1.2 一定不要用impyla中的executemany去批量插入數(shù)據(jù),也不要用其他的方式向hive插入數(shù)據(jù),都是坑!奇慢無(wú)比!找資料也都是說(shuō)不建議這么做。
長(zhǎng)途跋涉hdfs法
2.1 先用python的pyhdfs庫(kù)將結(jié)果寫(xiě)成hdfs文件,然后。。。尼瑪!!根本沒(méi)成功連上服務(wù)器的hdfs,本地hdfs到是可以的
2.2 那既然寫(xiě)hdfs,我就直接將模型結(jié)果通過(guò)hadoop/hdfs命令上傳至hdfs。然后, 通過(guò)hive命令load data將hdfs中的結(jié)果再導(dǎo)入hive。雖然有點(diǎn)繞,但是成功了!!!BUT!!!小兄弟,這個(gè)直接操作HDFS風(fēng)險(xiǎn)太高了,要不你還是另尋他法吧,不可以拒絕哦!!!
2.3 好吧,根據(jù)建議,使用kafka,抱歉這個(gè)坑后面再來(lái)踩。
2.4 臨時(shí)處理方案:先將結(jié)果寫(xiě)入mysql,再轉(zhuǎn)入hive,這個(gè)沒(méi)有坑,具體我也只是寫(xiě)到mysql,無(wú)坑。。就是有點(diǎn)繞。。。
以上這篇使用Python構(gòu)造hive insert語(yǔ)句說(shuō)明就是小編分享給大家的全部?jī)?nèi)容了,希望能給大家一個(gè)參考,也希望大家多多支持好吧啦網(wǎng)。
相關(guān)文章:
1. css進(jìn)階學(xué)習(xí) 選擇符2. ASP.NET Core實(shí)現(xiàn)中間件的幾種方式3. jsp實(shí)現(xiàn)textarea中的文字保存換行空格存到數(shù)據(jù)庫(kù)的方法4. 將properties文件的配置設(shè)置為整個(gè)Web應(yīng)用的全局變量實(shí)現(xiàn)方法5. JSP之表單提交get和post的區(qū)別詳解及實(shí)例6. asp讀取xml文件和記數(shù)7. JSP+Servlet實(shí)現(xiàn)文件上傳到服務(wù)器功能8. UDDI FAQs9. ASP常用日期格式化函數(shù) FormatDate()10. ASP基礎(chǔ)入門(mén)第三篇(ASP腳本基礎(chǔ))
