如何成为一名大数据工程师?


编译:勇哥
来源:网络大数据

未来,对熟练的大数据工程师的需求将急速增长。现实的情况是这样的,无论公司属于哪个行业,要想在当今竞争激烈的市场环境中取得成功,需要一个强大的软件架构用来存储和访问公司数据,最好从公司创立一开始就要搭建它。

 

在如今有时候有数据的地方就叫大数据,这未免有些夸张,在本文中统称为数据工程师和数据科学家

 

先了解一下,数据工程师究竟做什么事?一个人怎么样成为数据工程师?我们将讨论这个有趣的领域以及如何成为数据工程师。

 

数据工程师都做什么?

 

数据工程师负责创建和维护分析基础架构,该基础架构几乎可以支持数据世界中的所有其他功能。他们负责大数据架构的开发、构建、维护和测试,例如数据库大数据处理系统。大数据工程师还负责创建用于建模,挖掘,获取和验证数据集合等流程。

 

因此,数据工程师需要掌握通用脚本语言和工具,利用和改进数据分析系统,不断提高数据数量和质量。

 

数据工程师与数据科学家有何区别

 

虽然在技能和角色方面存在一定程度的重叠,但这两个职位正日益分化为不同的角色。

 

数据科学家更关注与数据基础设施的互动,而不是去创建和维护数据基础设施。通常负责进行市场和业务运营研究,以确定趋势和关系,数据科学家用各种复杂的机器和方法与数据进行交互并对其采取行动。

 

数据科学家通常精通机器学习和高级数据建模,因为他们希望借助高级数学模型和算法将原始数据转化为可操作的,可理解的内容。这些信息通常用作分析来源,以告诉决策者“更大的图景”。

 

那么是什么让数据科学家与数据工程师不同呢?两者主要区别在目标焦点。数据工程师更专注于构建用于数据生成和数据基础架构; 数据科学家专注于对生成的数据进行数学和统计分析。

 

数据工程师的关键技能

 

下面介绍数据工程师所需的几项关键技能。

 

1.大数据架构的工具与组件

 

数据工程师更关注分析基础架构,因此所需的大部分技能都是以架构为中心的。

 

2.深入了解SQL和其它数据库解决方案

 

数据工程师需要熟悉数据库管理系统,深入了解SQL至关重要。同样其它数据库解决方案,例如Cassandra或BigTable也须熟悉,因为不是每个数据库都是由可识别的标准来构建。

 

3.数据仓库和ETL工具

 

数据仓库和ETL经验对于数据工程师至关重要。像Redshift或Panoply这样的数据仓库解决方案,以及ETL工具,比如StitchData或Segment都非常有用。此外,数据存储和数据检索经验同样重要,因为处理的数据量是个天文数字。

 

4.基于Hadoop的分析(HBase,Hive,MapReduce等)

 

对基于Apache Hadoop的分析有深刻理解是这个领域的一个非常必要的需求,一般情况下HBase,Hive和MapReduce的知识存储是必需的。

 

5.编码

 

说到解决方案,编码与开发能力是一个重要的优点(这也是许多职位的要求),你要熟悉Python,C/C++,Java,Perl,Golang或其它语言,这会非常有价值。

 

6.机器学习

 

虽然数据工程师主要关注的是数据科学,但对数据处理技术的理解会加分,比如一些统计分析知识和基础数据建模。

 

机器学习已经成为标准数据科学,该领域的知识可以帮我们构建同类产品的解决方案。这种知识还有一个好处,就是让你在这个领域极具市场价值,因为在这种情况下能够“戴上两顶帽子”会让你成为一个更强大的工具。

 

7.多种操作系统

 

最后,需要我们对Unix,Linux和Solaris系统有深入了解,许多数学工具基于这些操作系统,因为它们有Windows和Mac系统功能没有的访问权限和特殊硬件需求。

 

如何成为数据工程师?

 

与其他职业相比,数据工程师需要用更复杂的学习方法。数据工程师通常有计算机科学技术相关学位会更好,然后再进一步学习供应商特定的认证计划和培训课程。

 

计算机相关学位虽然重要,但只是故事的一部分,获得适合的认证可能非常有价值,市场上也有一些大数据工程师专门认证,如下:

 

Google认证专家 – 数据工程。该认证表明学生熟悉数据工程原理,可以作为该领域的助理或专业人员。

 

IBM认证数据工程师 – 大数据。此认证更侧重于数据工程技能集的大数据特定应用,而不是一般技能,这被许多人视为黄金标准。

 

Cloudera的CCP数据工程师:该认证针对Cloudera解决方案,体现学生在ETL工具和分析方面的经验。

 

二级技能认证,例如MCSE(微软认证解决方案专家),涵盖更广泛的主题,但具有特定的子认证,如MCSE:数据管理与分析。

 

当然,在线教育平台提供该领域的重要培训,Udemy提供了数据工程众多的课程和数据科学,其他如EDX和Memrise也提供了类似课程,DataCamp专注于数据科学和工程,Galvanize的品类则更为广泛。

 

小结

 

虽然这些数据解决方案可以帮助您踏进大数据工程领域,虽然它们有分发或授予认证,但只是提供证书或文凭。虽然一般学习够了,但它们不能被认视为实际认证或实践的替代品。

 

希望本文能够给大家阐明数据工程师所需的特定知识,技能和要求。这个领域正在迅速发展,但它也充满了挑战与险阻。在工作中通过适当的认证填补技能组合的空白,实现最好学习的关键一步。

CPDA数据分析师课程海报