近日,數(shù)人云與清華大學(xué)交叉信息研究院開(kāi)放計(jì)算項(xiàng)目實(shí)驗(yàn)室(OCP實(shí)驗(yàn)室)合作共建深度學(xué)習(xí)平臺(tái),該平臺(tái)通過(guò)數(shù)人云操作系統(tǒng)實(shí)現(xiàn)GPU資源共享,利用Docker技術(shù)交付深度學(xué)習(xí)的運(yùn)行環(huán)境,讓深度學(xué)習(xí)項(xiàng)目組師生可以更加靈活地使用GPU資源,并解決深度學(xué)習(xí)環(huán)境部署繁瑣的問(wèn)題。
深度學(xué)習(xí)算法的計(jì)算性能依賴強(qiáng)大的GPU計(jì)算能力,為了盡可能提高GPU資源利用率,數(shù)人云利用Mesos將GPU資源匯聚成資源池實(shí)現(xiàn)資源共享,并借用Docker交付深度學(xué)習(xí)的運(yùn)行環(huán)境。
深度學(xué)習(xí)平臺(tái)利用nvidia-docker ( https://github.com/NVIDIA/nvidia-docker )容器化深度學(xué)習(xí)組件,同時(shí),借助數(shù)人云搭建GPU集群,共享GPU資源。最終,為用戶提供了可一條命令部署深度學(xué)習(xí)環(huán)境的平臺(tái)。
在節(jié)點(diǎn)內(nèi)部,數(shù)人云利用nvidia-docker幫助容器內(nèi)部的程序調(diào)用外面主機(jī)上的CUDA Driver。CUDA Driver及GPU Driver安裝在外部Host上,CUDA Toolkit,及其它深度學(xué)習(xí)組件及用戶應(yīng)用程序運(yùn)行在Docker容器中。這樣既能快速配置環(huán)境,又保證了HOST不受用戶應(yīng)用程序污染。
數(shù)人云打造的GPU集群,將深度學(xué)習(xí)的任務(wù)分配到服務(wù)器上,采用分布式計(jì)算方法,極大程度上提高了GPU的資源利用率。
2015年6月,F(xiàn)acebook資助清華大學(xué)交叉信息研究院,成立中國(guó)唯一的一家OCP實(shí)驗(yàn)室,自2015年9月開(kāi)始,數(shù)人云和清華大學(xué)交叉信息研究院助理院長(zhǎng)徐葳博士合作在OCP實(shí)驗(yàn)室開(kāi)展數(shù)據(jù)中心方面的相關(guān)研究工作。今年3月,數(shù)人云聯(lián)合清華大學(xué)OCP實(shí)驗(yàn)室完成“百萬(wàn)并發(fā)”壓力測(cè)試,數(shù)人云通過(guò)10臺(tái)OCP服務(wù)器成功承載了百萬(wàn)并發(fā)HTTP請(qǐng)求,并進(jìn)行了廣泛的性能測(cè)試。
關(guān)于數(shù)人云
數(shù)人云創(chuàng)始團(tuán)隊(duì)來(lái)自谷歌、紅帽和惠普,在今年3月初公司完成A輪融資,由云啟資本領(lǐng)投,思科、策源以及唯獵跟投。作為領(lǐng)先的云計(jì)算創(chuàng)新技術(shù)實(shí)踐者,數(shù)人云致力于為客戶提供領(lǐng)先的企業(yè)級(jí)容器解決方案,幫助傳統(tǒng)企業(yè)實(shí)現(xiàn)IT業(yè)務(wù)轉(zhuǎn)型,更好地應(yīng)對(duì)業(yè)務(wù)變化。數(shù)人云重點(diǎn)聚焦于打造輕量級(jí)PaaS平臺(tái),使用戶能夠在云主機(jī)、虛擬機(jī)甚至物理機(jī)上快速建立并穩(wěn)定運(yùn)行一個(gè)高擴(kuò)展性的生產(chǎn)環(huán)境,將應(yīng)用彈性做到極致。數(shù)人云操作系統(tǒng)基于領(lǐng)先的容器技術(shù),實(shí)現(xiàn)了一站式的微服務(wù)架構(gòu)集群系統(tǒng),最大化地幫助客戶實(shí)現(xiàn)應(yīng)用業(yè)務(wù)在云端的快速部署,解決應(yīng)用上云的最后一公里。




