




下載本文檔
版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請進行舉報或認領(lǐng)
文檔簡介
單項選擇題1.下列各項不屬于數(shù)據(jù)的是()。A.文本B.圖像C.視頻D.印象2.下列各項不屬于大數(shù)據(jù)特征的是()。A.體量大B.種類多C.真實性D.數(shù)據(jù)生成慢3.數(shù)據(jù)異常值的處理方法不包括()。A.極小值替換B.刪除C.忽略D.視為缺失值進行填補4.下列各項不能用于描述數(shù)據(jù)集中趨勢的是()。A.方差B.平均數(shù)C.中位數(shù)D.峰值5.下列各項不屬于Hadoop的特點是()。A.存儲迅速B.成本高C.計算能力強D.靈活性強6.在工業(yè)網(wǎng)絡(luò)實時監(jiān)控系統(tǒng)中,需要連續(xù)不斷地采集和處理數(shù)據(jù)。以下()不屬于這種計算模式。A.在線處理 B.實時處理 C.流式計算 D.批量計算7.下面不是研究數(shù)據(jù)方法的是()。A.統(tǒng)計學(xué)B.機器學(xué)習(xí)C.心理分析D.數(shù)據(jù)挖掘8.下面不屬于大數(shù)據(jù)的處理過程的是()。A.數(shù)據(jù)獲取B.數(shù)據(jù)清洗C.數(shù)據(jù)分析D.數(shù)據(jù)安全9.下面不屬于大數(shù)據(jù)計算模式的類型的是()。A.批量計算B.手動計算C.流式計算D.交互式計算10.下列各項屬于合規(guī)數(shù)據(jù)的是()。A.非法收集隱私信息數(shù)據(jù)B.取得使用者同意的個人資料數(shù)據(jù)C.泄露的隱私信息數(shù)據(jù)D.壟斷數(shù)據(jù)11.在Hadoop生態(tài)系統(tǒng)中,主要負責(zé)節(jié)點集群的任務(wù)調(diào)度和資源分配,將存儲和計算資源分配給不同應(yīng)用程序的組件是()。A.HDFSB.MapReduceC.YARND.Storm12.下列屬于圖數(shù)據(jù)的主要特性的是()。A.數(shù)據(jù)驅(qū)動計算B.不規(guī)則問題C.高數(shù)據(jù)訪問率D.以上均是13.可以用來查看數(shù)值型變量的分布的可視化方法是()。A.箱線圖B.直方圖C.小提琴圖D.以上方法均可以14.如果只是研究兩個數(shù)值變量之間的關(guān)系,最常見的可視化方法是()。A.直方圖B.散點圖C.餅圖D.折線圖15.下列各項不屬于批處理系統(tǒng)的特點的是()。A.可以實現(xiàn)實時的分析報告或自動響應(yīng)B.可以實現(xiàn)無縫擴展以處理峰值數(shù)據(jù)量或數(shù)據(jù)請求C.支持數(shù)據(jù)在不同系統(tǒng)之間進行交換D.支持作業(yè)執(zhí)行狀態(tài)的監(jiān)控16.下列各項屬于非結(jié)構(gòu)化數(shù)據(jù)的是()。A.圖像 B.二維數(shù)據(jù)表 C.HTML文檔D.以上均是17.在大數(shù)據(jù)的處理流程中,()步驟是將數(shù)據(jù)轉(zhuǎn)化為圖形,以更直觀的方式展示和表達。A.存儲與管理B.可視化C.采集與預(yù)處理D.分析與挖掘18.下列關(guān)于異常值的描述中,錯誤的是()。A. 可以使用箱線圖檢測異常值B. 當(dāng)異常值的數(shù)量不是很多時,可以直接將含有異常值的觀測記錄刪除C. 可以將異常值視為缺失值,按處理缺失值的方法處理異常值D. 異常值的存在不屬于數(shù)據(jù)質(zhì)量問題,不會影響模型的預(yù)測能力19.下列各項關(guān)于分類的描述中,錯誤的是()。A.可以借助分類方法根據(jù)電子郵件的標題判斷其是否為垃圾郵件B.在進行建模之前就要有明確的分組預(yù)測目標C.k近鄰算法是一種簡單但強大的分類算法D.用來建立分類模型的輸入數(shù)據(jù)稱為測試集20.假設(shè)散點圖中的觀測點分布較為分散,沒有任何規(guī)律,說明兩個變量之間的關(guān)系為()。A.完全線性相關(guān)B.線性相關(guān)C.非線性相關(guān)D.不相關(guān)21.在Hadoop生態(tài)系統(tǒng)中,主要負責(zé)跨節(jié)點存儲結(jié)構(gòu)化或非結(jié)構(gòu)化數(shù)據(jù),并以日志文件的形式管理數(shù)據(jù)的組件是()。A.HDFSB.MapReduceC.YARND.Storm22.下列各項不屬于批處理系統(tǒng)的特點的是()。A.為開發(fā)者提供了一個簡單、快捷的開發(fā)框架B.支持各種數(shù)據(jù)格式的處理C.支持數(shù)據(jù)在不同系統(tǒng)之間進行交換D.可以實現(xiàn)實時的分析報告或自動響應(yīng)23.為表示一組數(shù)據(jù)的分布特征,反映數(shù)據(jù)分布是否對稱時,常用的可視化方法是()。A.箱線圖B.氣泡圖C.折線圖D.散點圖24.如果要反映某學(xué)生在6個學(xué)期中每學(xué)期平均成績的變化情況,采用()可視化方法較為合適。A.餅圖 B.折線圖 C.散點圖 D.直方圖25.下列各項屬于結(jié)構(gòu)化數(shù)據(jù)的是()。A.圖像 B.二維數(shù)據(jù)表 C.聲音 D.文本26.在大數(shù)據(jù)的處理流程中,下列各項中最先進行的是()。A.存儲與管理B.可視化C.采集與預(yù)處理D.分析與挖掘27.下列關(guān)于缺失值的描述中,錯誤的是()。A. 缺失值是指數(shù)據(jù)集中有些變量的一個或多個取值無法獲得B. 數(shù)據(jù)缺失的現(xiàn)象大量存在C. 回歸插補的方法不會改變數(shù)據(jù)分布D. 當(dāng)缺失數(shù)據(jù)的記錄所占比例在數(shù)據(jù)集中少于10%時,可以將缺失值直接刪除28.下列各項關(guān)于聚類的描述中,錯誤的是()。A.可以借助聚類方法進行異常檢測B.在進行建模之前就要有明確的分組預(yù)測目標C.可以利用聚類分析發(fā)現(xiàn)具有相似功能的基因組D.根據(jù)數(shù)據(jù)本身的自然結(jié)構(gòu)對數(shù)據(jù)進行分組29.假設(shè)散點圖中的觀測點恰好落在一條直線上,說明兩個變量之間的關(guān)系為()。A.完全線性相關(guān)B.線性相關(guān)C.非線性相關(guān)D.不相關(guān)30.下列各項屬于數(shù)據(jù)倉庫的特點的是()。A.數(shù)據(jù)以主題為導(dǎo)向,提供決策支持B.數(shù)據(jù)源單一C.數(shù)據(jù)質(zhì)量低D.不支持歷史數(shù)據(jù)分析31.根據(jù)原始數(shù)據(jù)是否為數(shù)據(jù)的直接來源,可以將數(shù)據(jù)分為()。A.結(jié)構(gòu)化、非結(jié)構(gòu)化和半結(jié)構(gòu)化數(shù)據(jù)B.一手數(shù)據(jù)和二手數(shù)據(jù)C.觀測數(shù)據(jù)和實驗數(shù)據(jù)D.截面數(shù)據(jù)和時間序列數(shù)據(jù)32.大數(shù)據(jù)5V特征中的Variety表示()。A.體量大B.種類多C.價值大D.數(shù)據(jù)快33.大數(shù)據(jù)處理流程中的()步驟是將數(shù)據(jù)轉(zhuǎn)化為圖形,以更直觀的方式展示和表達。A.數(shù)據(jù)的采集與預(yù)處理B.數(shù)據(jù)的存儲與管理C.數(shù)據(jù)的可視化D.數(shù)據(jù)的分析與挖掘34.下列各項不屬于大數(shù)據(jù)在銀行業(yè)的應(yīng)用的是()。A.客戶分析B.風(fēng)險管理C.運營優(yōu)化D.疾病預(yù)防與治療35.數(shù)據(jù)的整理是根據(jù)分析目的對數(shù)據(jù)格式、形態(tài)和結(jié)構(gòu)進行處理,其中()能夠在不損失或損失較少數(shù)據(jù)本身價值的情況下壓縮數(shù)據(jù)。A.數(shù)據(jù)的聚合B.數(shù)據(jù)的提取C.數(shù)據(jù)的連接D.數(shù)據(jù)的變換36.關(guān)于數(shù)據(jù)的離散化,下列描述中錯誤的是()。A.數(shù)據(jù)的離散化是指將數(shù)據(jù)由分類型變量變成數(shù)值型變量。 B.離散化可以提高大數(shù)據(jù)處理的效率 C.組距分組是常見的離散化方法之一D.離散化可以實現(xiàn)樣本量的縮減37.異常值的處理方法包括()。A.刪除B.視為缺失值進行填補C.忽略D.以上均是38.下列關(guān)于數(shù)據(jù)倉庫三層架構(gòu)的描述中,正確的是()。A.頂層由聯(lián)機分析處理服務(wù)器組成B.底層由數(shù)據(jù)倉庫服務(wù)器組成C.中間層由前端用戶界面表示D.數(shù)據(jù)在中間層完成加載和存儲39.HDFS的高可用性是指()。A.隨著需求的增加,集群可以輕松擴展到更多節(jié)點B.實現(xiàn)節(jié)點集群上的并行數(shù)據(jù)處理C.即使集群中的某個節(jié)點發(fā)生故障,數(shù)據(jù)仍然可用D.出現(xiàn)故障時,可以從集群中的其他節(jié)點獲取數(shù)據(jù)備份40.下列各項不屬于NoSQL數(shù)據(jù)庫的是()。A.關(guān)系數(shù)據(jù)庫B.文檔數(shù)據(jù)庫C.鍵值存儲數(shù)據(jù)庫D.圖形數(shù)據(jù)庫41.以下可視化圖形中,()是由數(shù)據(jù)集合中的最大值、最小值、中位數(shù)和兩個四分位數(shù)繪制而成。A.柱形圖B.餅圖C.箱線圖D.直方圖42.以下常用于時間序列數(shù)據(jù)可視化的方法是()。A.折線圖B.直方圖C.餅圖D.箱線圖43.下列關(guān)于推斷統(tǒng)計學(xué)的描述中,錯誤的是()。A.參數(shù)估計是根據(jù)樣本的統(tǒng)計量來估計總體中的參數(shù)B.假設(shè)檢驗可以度量變量之間的相關(guān)程度C.判別分析是將某個對象歸到已知類別中D.時間序列分析是研究時間序列數(shù)據(jù)變化規(guī)律的方法44.根據(jù)概率的原則進行分類的機器學(xué)習(xí)算法是()。A.k近鄰算法B.決策樹C.樸素貝葉斯分類器D.隨機森林45.以下關(guān)于關(guān)聯(lián)規(guī)則的描述中,錯誤的是()。A.可以用于預(yù)測商品的價格B.可以用于找到商品之間的關(guān)聯(lián)C.可以用于購物籃數(shù)據(jù)分析D.可以用于電商的推薦系統(tǒng)46.在以二維表形式表示的數(shù)據(jù)集中,行表示()。A.特征B.樣本C.屬性D.字段47.當(dāng)一個變量可以在一個范圍內(nèi)連續(xù)取值時,該變量就是()。A.定量變量B.定性變量C.屬性變量D.分類變量48.傳統(tǒng)的主要基于統(tǒng)計學(xué)的分析方法在大數(shù)據(jù)時代所面臨的挑戰(zhàn)包括()。A.全體數(shù)據(jù),不是隨機樣本B.放棄數(shù)據(jù)的精確性,盡可能收集更多數(shù)據(jù)C.重視相關(guān)關(guān)系,而不是因果關(guān)系D.以上均是49.以下關(guān)于基于關(guān)聯(lián)規(guī)則的推薦算法的描述中,正確的是()。A.根據(jù)用戶對商品或內(nèi)容的收藏或分享等情況判斷用戶對該商品的興趣和偏好程度B.根據(jù)用戶的基本信息發(fā)現(xiàn)用戶之間的相似情況,將相似用戶喜愛的的其他商品推薦給當(dāng)前用戶C.挖掘不同商品在銷售過程中的相關(guān)性D.根據(jù)商品本身的屬性數(shù)據(jù),計算商品之間的相似度,再基于用戶的歷史瀏覽等信息推薦給用戶相似的商品50.使用Python進行網(wǎng)絡(luò)爬蟲獲取網(wǎng)頁數(shù)據(jù)時,正確的步驟是()。A.發(fā)送請求-獲取內(nèi)容-解析內(nèi)容-保存數(shù)據(jù)B.保存數(shù)據(jù)-發(fā)送請求-獲取內(nèi)容-解析內(nèi)容C. 獲取內(nèi)容-解析內(nèi)容-發(fā)送請求-保存數(shù)據(jù)D. 解析內(nèi)容-保存數(shù)據(jù)-獲取內(nèi)容-發(fā)送請求51.在缺失值的處理方法中,()是利用樣本觀測之間的相關(guān)性來插補缺失值。A.均值插補B.回歸插補C.多重插補D.k近鄰算法插補52.下列關(guān)于離散化處理的描述中,錯誤的是()。A.離散化處理可以提高大數(shù)據(jù)處理的效率B.在調(diào)查問卷中,離散化處理可以得到更高的響應(yīng)率C.數(shù)據(jù)經(jīng)過離散化后,可以獲得更好的模型解釋性D.離散化處理不會影響預(yù)測精度53.氣泡圖中可以用來展示數(shù)據(jù)信息的屬性包括()。A.僅橫坐標B.僅橫坐標和縱坐標C.僅橫坐標、縱坐標和氣泡大小D.橫坐標、縱坐標、氣泡大小和氣泡顏色54.下列關(guān)于數(shù)據(jù)倉庫的特點,描述錯誤的是()。A.數(shù)據(jù)以主題為導(dǎo)向,提供決策支持B.關(guān)注數(shù)據(jù)隨時間的變化,支持歷史數(shù)據(jù)分析C.數(shù)據(jù)質(zhì)量高,提供數(shù)據(jù)一致性和準確性D.數(shù)據(jù)源和數(shù)據(jù)類型單一55.HDFS的可擴展性主要體現(xiàn)在()。A.隨著需求的增加,集群可以輕松擴展到更多節(jié)點B.即使集群中的某個節(jié)點發(fā)生故障,數(shù)據(jù)依然可用C.以分布式方式存儲數(shù)據(jù),減少處理時間D.確保數(shù)據(jù)始終可用,防止數(shù)據(jù)丟失56.下列數(shù)據(jù)庫中,屬于文檔數(shù)據(jù)庫的是()。A.RedisB.Neo4jC.HBaseD.MongoDB判斷題1.根據(jù)數(shù)據(jù)在收集過程中是否控制有關(guān)因素,可以將數(shù)據(jù)分為觀測數(shù)據(jù)和實驗數(shù)據(jù)。()2.時間序列分析中采用對數(shù)變換來消除異方差。()3.關(guān)系型數(shù)據(jù)庫不是用來存儲和訪問具有彼此相關(guān)性數(shù)據(jù)的數(shù)據(jù)庫。()4.氣泡圖中氣泡的面積大小沒有實際意義。()5.數(shù)據(jù)科學(xué)是通過科學(xué)方法探索數(shù)據(jù),以獲得有價值的發(fā)現(xiàn)。()6.數(shù)據(jù)科學(xué)的發(fā)展不僅可以推動學(xué)科的發(fā)展,而且能夠助推相關(guān)產(chǎn)業(yè)的發(fā)展與進步。()7.網(wǎng)頁數(shù)據(jù)是一種半結(jié)構(gòu)化數(shù)據(jù)。()8.在分類方法中,決策樹法的結(jié)果復(fù)雜難懂、可解釋性較差。()9.MapReduce編程模型的首要步驟是對存儲系統(tǒng)中的文件按列處理,并產(chǎn)生鍵值對。()10.MapReduce基于分而治之的算法范式,利用多臺計算機完成數(shù)據(jù)處理()11.銀行業(yè)通過大數(shù)據(jù)技術(shù)可以有效分析經(jīng)營過程中可能存在的風(fēng)險因素。()12.數(shù)據(jù)脫敏技術(shù)可以有效降低敏感數(shù)據(jù)泄露的風(fēng)險。()13.時間序列數(shù)據(jù)是按時間順序排列的觀測值序列,用于所描述現(xiàn)象隨時間變化的情況。()14.數(shù)據(jù)預(yù)處理的主要目的是為了提高數(shù)據(jù)質(zhì)量,將原始數(shù)據(jù)變成更加方便計算或處理的格式,使數(shù)據(jù)形態(tài)更加符合建模要求,進而提升數(shù)據(jù)挖掘的質(zhì)量和效率。()15.數(shù)據(jù)可視化對于提升數(shù)據(jù)的理解、分析與推斷沒有幫助。()16.HDFS架構(gòu)遵循主從結(jié)構(gòu),主節(jié)點稱為數(shù)據(jù)節(jié)點,負責(zé)接收來自客戶端的作業(yè)請求。()17.通常使用直方圖展示兩個數(shù)值型變量之間的相關(guān)關(guān)系。()18.決策樹是一種簡單高效的分類模型。()19.Excel只能存儲數(shù)據(jù),無法用于數(shù)據(jù)分析。()20.為防止隱私被竊取,企業(yè)和個人可以運用隱私保護技術(shù)來保護數(shù)據(jù)的安全。()21.為了避免數(shù)據(jù)的雜亂無序,通常將數(shù)據(jù)整理成數(shù)據(jù)集。()22.辦公文檔、圖像、聲音和文本都是結(jié)構(gòu)化數(shù)據(jù)。()23.疾病預(yù)防和治療屬于大數(shù)據(jù)在生物醫(yī)學(xué)領(lǐng)域的應(yīng)用。()24.數(shù)據(jù)缺失的現(xiàn)象大量存在而又無法避免。()25.特征選擇是指由原始變量的函數(shù)構(gòu)造一些新的變量,新的變量能保留原始變量的絕大部分信息。()簡答題1.變量的定義是什么?用于刻畫觀測數(shù)據(jù)集的特征的量叫做變量。2.請列舉三種常用的電子商務(wù)推薦算法。協(xié)同過濾推薦算法;基于內(nèi)容的推薦算法;基于關(guān)聯(lián)規(guī)則的推薦算法;基于人口統(tǒng)計的推薦算法。3.請列舉五種常見的數(shù)據(jù)缺失值插補方法。均值插補;回歸插補;隨機回歸插補;多重插補;K近鄰算法插補4.數(shù)據(jù)可視化的基本原則包括哪些方面?數(shù)據(jù)可視化的效果要能準確的表達數(shù)據(jù)中的信息而不產(chǎn)生偏差或歧義;能夠清晰地表達數(shù)據(jù)中的信息;其設(shè)計的可視化圖表能夠令人賞心悅目。5.數(shù)據(jù)的定義是什么?數(shù)據(jù)是對現(xiàn)象或事物進行測量和記錄的結(jié)果,可用來制表、計算和分析等,也可以統(tǒng)指一切保存在電腦中的信息,能夠進行電子化的記錄,包括文本、圖像、音頻、視頻等。6.大數(shù)據(jù)的成因是什么?數(shù)據(jù)的存儲和管理能力的增強;數(shù)據(jù)采集能力增強;大數(shù)據(jù)的挖掘和分析等技術(shù)的同步發(fā)展。7.數(shù)據(jù)整理的內(nèi)容主要包括哪四個方面?數(shù)據(jù)的提取;數(shù)據(jù)的連接;數(shù)據(jù)的聚合;去除冗余和重復(fù)。8.通過相關(guān)系數(shù)矩陣處理共線性問題的算法步驟是什么?計算相關(guān)系數(shù)矩陣;確定最大的成對相關(guān)系數(shù)對應(yīng)的預(yù)測變量A和預(yù)測變量B;計算變量A與其他所有變量之間的平均絕對值相關(guān)系數(shù),對變量B也做同樣的計算;比較A與B,誰的平均絕對值相關(guān)系數(shù)最大,刪除誰;重復(fù)
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
- 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
- 5. 人人文庫網(wǎng)僅提供信息存儲空間,僅對用戶上傳內(nèi)容的表現(xiàn)方式做保護處理,對用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對任何下載內(nèi)容負責(zé)。
- 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請與我們聯(lián)系,我們立即糾正。
- 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔(dān)用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。
最新文檔
- 2025山東濟南軌道交通酒店管理有限公司招聘13人筆試參考題庫附帶答案詳解
- 黔西南民族職業(yè)技術(shù)學(xué)院《生態(tài)規(guī)劃與管理》2023-2024學(xué)年第二學(xué)期期末試卷
- 周口理工職業(yè)學(xué)院《成衣基礎(chǔ)工藝》2023-2024學(xué)年第二學(xué)期期末試卷
- 酒泉職業(yè)技術(shù)學(xué)院《熱工基礎(chǔ)》2023-2024學(xué)年第二學(xué)期期末試卷
- 安康職業(yè)技術(shù)學(xué)院《服務(wù)器維護管理》2023-2024學(xué)年第二學(xué)期期末試卷
- 東南大學(xué)成賢學(xué)院《風(fēng)險投資理論與實務(wù)》2023-2024學(xué)年第二學(xué)期期末試卷
- 衡水健康科技職業(yè)學(xué)院《花卉學(xué)實驗》2023-2024學(xué)年第二學(xué)期期末試卷
- 皖西衛(wèi)生職業(yè)學(xué)院《化學(xué)設(shè)計性實驗》2023-2024學(xué)年第二學(xué)期期末試卷
- 西南財經(jīng)大學(xué)《醫(yī)藥數(shù)理統(tǒng)計學(xué)》2023-2024學(xué)年第二學(xué)期期末試卷
- 阿克蘇職業(yè)技術(shù)學(xué)院《建筑設(shè)計(一)》2023-2024學(xué)年第二學(xué)期期末試卷
- (翻譯)UL6A標準中文版-2019版電氣剛性金屬導(dǎo)管-鋁紅黃銅和不銹鋼
- 2024年信息系統(tǒng)項目管理師(綜合知識、案例分析、論文)合卷軟件資格考試(高級)試題與參考答案
- 小學(xué)班會 以“心”迎新 攜手同行-二年級數(shù)學(xué)開學(xué)家長會 課
- 疑似新冠肺炎的應(yīng)急演練
- 資治通鑒介紹課件
- 2025年湖北省武漢市高考數(shù)學(xué)模擬試卷(附答案解析)
- 賽迪顧問一線調(diào)研第36期:中國人工智能醫(yī)療器械:前路漫漫仍需披荊斬棘
- 配電工程 投標方案(技術(shù)方案)
- GB/T 19274-2024土工合成材料塑料土工格室
- 重慶市巴蜀學(xué)校高2025屆高二(下)期末考試+化學(xué)試卷(無答案)
- 2020年湖南省普通高中學(xué)業(yè)水平考試數(shù)學(xué)試題(含答案解析)
評論
0/150
提交評論