数据湖在商业智能中的应用:来自一线的报告

摘要

数据湖方法已成为处理大量结构化和非结构化数据的一种有前景的方法。这个大数据技术使企业能够显著提升其商业智能。然而,关于数据湖方法在企业中应用的实证研究仍然缺乏。本文提供了一项探索性研究的结果,旨在增进对数据湖方法在企业中应用的理解。我访谈了12位在不同企业中实施过该方法的专家,识别出实施数据湖的三个重要目的:(1)作为数据仓库的暂存区或源;(2)作为数据科学家和分析师的实验平台;(3)作为自助式商业智能的直接来源。该研究还识别出数据湖方法的若干感知收益与挑战。研究结果可能对学术界和实践者均有裨益。此外,本文还提出了未来研究的建议。

关键词

商业智能;大数据;数据湖;商业智能架构。

1. 引言

商业智能(BI)是一种现代方法,它结合了方法论、流程、架构和技术,将原始数据转化为有意义的信息以支持决策 [1]。BI 可在提升组织绩效方面发挥关键作用,包括识别新机遇、揭示潜在威胁、发现商业洞察以及优化决策过程 [2, 3]。因此,BI 已成为大多数行业中各组织的首要任务 [4]。传统上,BI 主要关注结构化的企业内部数据,而忽视了蕴含在非结构化和外部数据中的潜在有价值信息。这可能导致对现实的不完整认知以及有偏见的企业决策 [5]。

互联网、网络和云计算技术的加速发展和广泛普及赋予了“信息过载”这一短语新的含义 [6]。这些技术进步导致了前所未有的海量数据的产生和数据积累。大规模复杂数据通常用“大数据”这一概念来描述 [7]。

随着大数据的日益可用,分析不断增长的大型数据集的挑战也变得更加紧迫。因此,当今的商业智能面临着新的挑战,同时也迎来了令人振奋的机遇 [5]。

大数据是2000年代的热门术语之一 [8]。最早采用大数据的组织是在线企业和初创公司。根据戴文波特和迪谢 [8] 的说法,谷歌、易贝和脸书等公司从一开始就围绕大数据建立。大数据改变了企业处理数据的方式,不仅提供了处理数据的新机遇,还提供了利用物联网(IoT)、社交媒体、网络日志和传感器产生的海量数据并为其增值的新方法 [9]。大数据还支持将数据作为组织可利用的资源进行供给 [10]。

大数据还催生了数据湖等现代技术,使企业能够以其原始格式存储和处理大量结构化和非结构化数据。然而,尽管该技术已广泛使用,我们的文献检索却仅发现少数研究讨论了数据湖。其中一项研究对数据湖进行了简要讨论 [11],而另一项 [12] 则详细探讨了数据湖的一些挑战。然而,我们未发现有关企业在实际中使用数据湖的实证研究。

本研究的主要目标是了解数据湖在商业智能架构中的作用,以及企业如何在实践中使用数据湖。以下研究问题指导了本次研究:

  • 在商业智能架构中实施数据湖的目的是什么?
  • 数据湖如何影响企业的商业智能架构?
  • 在商业智能架构中实施数据湖的好处和挑战是什么?

由于该主题在以往的研究中尚未被实证研究,本研究对来自各个行业的商业智能专家进行了探索性研究。在本文的下一节中,我将讨论本研究的理论背景。然后,通过描述数据收集和数据分析流程,说明探索性研究的方法。接着,呈现本次探索性研究的结果。文章最后对研究发现、未来研究方向以及结论进行讨论,并指出本研究的局限性。

2. 理论背景

大数据这一术语指的是组织当前正在经历的数据量的巨大增长 [2]。大数据还可以指数据存储和数据处理方面的技术发展,这些技术使得以任何格式应对数据量的指数级增长成为可能 [13, 14]。另一个公认的大数据定义基于3-V模型 [2],该模型包含数据增长中的三个挑战维度:数据量、速度和多样性。数据量指的是数据的不断增长;速度描述了新数据生成的速度以及数据可供进一步分析的访问速度;最后,多样性描述了不同数据源和数据类型的范围。最近,学者们提出了第四个V:价值,强调了利用数据创造价值的重要性 [14]。

商业智能与大数据密切相关,因为商业智能为数据分析提供了方法论和技术能力 [13]。商业智能是一个总称,指利用数据集成和分析来改进决策的决策支持系统 [15]。因此,它被广泛用于描述各种不同的信息分析应用,这些应用基于更广泛的知识支持科学决策 [16]。典型的商业智能架构包括数据源层、抽取‐转换‐加载(ETL)层、数据仓库层和最终用户层,以及一个元数据层 [17]。在这些层次中,数据仓库层是最重要的层次之一。数据仓储涉及将数据从一组源系统移动到目标存储库 [16]。提取的数据随后被发送到称为数据暂存区的临时存储区域 [18]。数据转换描述了通过一组业务规则将数据转换为一致格式以用于报告与分析的过程。这些经过转换的数据随后被加载到数据仓库中。因此,数据仓库也可以被定义为中央存储,用于收集和存储来自内部和外部数据源的数据,以支持战术和战略决策 [19]。

“大数据”这一术语被创造出来,用以描述因海量数据、数据持续流动、多种数据源和多种数据格式而形成的技术格局。数据是商业智能 [14] 的基础资源。可以说,正是数据可用性的不断提升,推动了商业智能项目和方法论 [11] 的变革。像数据湖这样的现代技术使得在尚未完全了解数据结构的情况下也能获取数据成为可能 [11]。数据湖是一种用于存储大量且多样数据的存储库,涵盖结构化和非结构化数据 [20]。该术语最早由Pentaho的首席技术官(CTO)詹姆斯·迪克森提出,旨在表达一种集中式存储库的概念,其中包含近乎无穷尽的原始数据,可用于分析或未来尚未确定的用途 [12]。数据湖还提供存储和处理能力,以支持对大规模非结构化数据集的分析。

各个行业的企业开始将数据存入数据湖中,而无需执行任何数据转换 [20]。现有文献中关于数据湖技术的研究较少。拉尔森和张 [11] 进行了一项研究,定义了数据湖概念。他们认为,数据湖技术作为一种新型数据存储库应运而生,能够提供存储和处理能力,以支持对大规模非结构化数据集的分析。特里赞诺等人 [12] 的研究提出并描述了数据湖技术的挑战。他们提出了一种简单的方法来处理以下问题:数据选择、描述、维护和治理。一些研究提出了数据湖与企业系统(如企业内容管理(ECM)和企业资源计划(ERP))的集成。在ECM中,数据湖用于捕获、创建、索引、搜索、访问、组织和维护所有组织内容,无论数据格式如何 [21]。因此,ECM软件包可以支持从结构化良好的数据到非结构化数据的各种数据。ERP使用数据湖,使得数据可以在初始交易时一次性收集,集中存储,并实时更新 [22]。然而,目前尚无研究实证考察数据湖在企业中的应用。此外,商业智能文献也未探讨数据湖如何影响商业智能架构。

3. 研究方法

在本探索性研究中,采用了默泽和纳格尔的专家访谈技术 [23]。数据来自对挪威不同行业的12位商业智能专家进行的半结构化访谈。通过领英根据其作为受访者的适宜性确定了专家人选。此外,还采用了滚雪球抽样技术,即要求每位受访者推荐其他可能的受访者。受访者的角色概述见表1。每次访谈持续约30至60分钟,并进行了数字录音。访谈中,基于受访者的经验,探究了有关商业智能实施、商业智能架构以及数据湖技术的信息。

所有访谈均被转录,并使用NVivo进行分析。为了开展数据分析,采用了Braun和Clarke的主题分析指南 [24],该指南定义了六个分析阶段。第一阶段,作者对数据进行熟悉。在此阶段,反复阅读数据并记录初步想法。第二阶段是生成初始编码。对整个数据集中数据的有趣特征进行系统性编码,并汇总与每个编码相关的数据。第三阶段是寻找主题。将编码归类为潜在主题,并收集与每个潜在主题相关的所有数据。第四阶段是审查主题。在此过程中,作者检查这些主题是否与第一阶段的编码摘录以及第二阶段的整个数据集相符。第五阶段涉及定义和命名主题。在这一阶段,回顾整体分析,为每个主题生成清晰的定义和名称。最后,撰写了一份分析报告,该报告在结果部分中呈现。

表1. 受访者的角色和行业领域

Role 行业 商业智能经验(年)
商业智能主管 IT咨询公司 11
分析主管 保险 10
分析主管 公共部门 20
数据经理 商业智能软件提供商 10
数据仓库主管 IT咨询公司 7
商业智能顾问 商业智能软件提供商 17
数据治理负责人 保险 10
商业智能架构师 IT咨询公司 20
数据科学家 IT咨询公司 6
数据科学家 IT咨询公司 10
商业智能顾问 IT咨询公司 8
业务分析顾问 保险 10

4. 结果

本节展示了访谈的结果。首先,我介绍了受访者如何定义数据湖方法,接着阐述了数据湖的感知优势。然后,我探讨了企业中数据湖的目的,并分析了其面临的挑战。

受访者从两个角度定义了数据湖:技术角度和业务角度。从技术角度来看,一位受访者表示:“对我来说,数据湖是存储在特定格式中的数据及相关所需技术的集合。因此,数据湖并非单一的存在,而是多种技术的组合,用以满足数据的需求。” 大多数受访者还解释说,数据湖是任何类型数据的中央存储库,也是真实性的中央存储库。然而,也有少数受访者从业务角度来定义数据湖。例如,其中一位受访者提到:“对我来说,数据湖是一种业务能力,使你能够获取来自不同源系统的原始、未更改的数据。” 该受访者还表示:“数据湖就是我可以在企业中获取所有数据的地方。”

4.1. 数据湖的感知优势

受访者强调了数据湖的四个感知收益:通过数据存储减少前期工作、更好的数据获取、快速访问原始数据以及数据保存。

首先,大多数受访者强调,数据湖减少了前期工作量,因为他们可以以任何格式摄取数据,而无需初始模式。他们解释说,这种早期摄取和后期处理数据的方式是数据湖的创新之一。其中一位受访者表示:“这类似于ELT,其中T在最后执行,有时在读取数据时才动态定义。” 同样,一位受访者解释说:“当你有了数据湖概念后,你可以选择存储数据,因为你不必事先定义数据[相对于]你[将如何]存储它,[…]因为那非常耗时。因此,借助数据湖,你可以说,‘我只是想把数据存起来,因为存储数据的成本如此之低,实际上保存它们比需要时没有数据更便宜。’” 受访者表示,数据湖使他们能够在企业明确业务需求之前,推迟模式开发和数据清理工作。

受访者指出的数据湖的另一个优势是,数据湖使得获取新数据变得更加容易。其中一位受访者提到:“在数据湖中,你只需说‘我们把所有数据都 dumped 进去’。我们将来自各个源系统的数据全部放入数据湖 […] 因为这样比重构数据要快得多。” 受访者还指出,数据湖可以存储各种类型的数据,从而减少了数据获取的工作量。此外,一位受访者表示:“[通常]情况下,你不被允许直接从源系统获取数据,因为存在诸如‘不要干扰运行中的系统’之类的政策。所以这就他们为什么需要一份数据副本。而数据湖使这些变得规范化,因此你拥有一个统一的地方、一个统一的数据池来存放所有数据。” 另一位消息人士表示:

从数据科学家或分析师需要数据到将数据放入数据湖的时间非常短。之所以时间很短,是因为我们不对数据应用业务规则:我们只是将数据直接转储到其中,且没有固定格式。因此,基本上当我们将数据放入数据湖时,仅对其进行基本的治理,例如确保拥有正确的访问控制,并将数据标记在正确的位置。

因此,这位信息提供者认为,将新数据获取到数据湖中所需的工作量很少。

访谈指出,数据湖的另一个好处是能够快速访问原始数据。大多数受访者认为,快速访问原始数据对任何企业都有益处。例如,一位受访者指出:“有了数据湖,首先数据已经在那里 […] 这意味着当业务用户提出问题时,数据科学家或分析师可以立即进入其中提取数据,并进行数据转换,使其符合业务问题的需求。因此,这要快得多。” 此外,其中一位受访者将数据湖与数据仓库进行了比较,指出:“许多数据仓库实际上已经剔除了所有错误;他们去除了各种原因导致的无效数据 […] 而数据湖则让您能够访问到这些从未被使用的全部信息,包括那些由于错误而在源系统中甚至不可见的记录。” 因此,受访者认为,数据湖使数据能够快速可用,尤其适用于数据科学、分析以及研发。

最后,许多受访者认为将数据以原始格式保存是数据湖的好处之一。大多数受访者强调了能够访问原始或未触碰的数据的重要性。例如,一位受访者表示:“当数据被转换、聚合、截断和更新后,大多数组织通常难以将数据关联起来。” 同样,另一位受访者指出:“当你有一个数据仓库 […], 时,你永远不会读取所有表。你会忽略那些被某些人认为不重要的表。但随后,另一个人却希望对这些被认定为不重要的数据进行分析,而他却无法在数据仓库中获取这些数据,因此无法完成分析。” 同样,其中一位受访者强调了原始数据的重要性,他表示:“在我看来,所有数据都有某种结构,然后你说这些数据不能用——它不是为了那个特定目的而存在的——接着你却将其输入模型。但在我看来,模型仅仅是模型:它们并非真实。真实存在于原始数据中。” 最后,受访者指出,当数据以其原始形式保存时,随着新的业务需求出现,这些数据可以被反复使用。

4.2. 数据湖的目的

访谈揭示了数据湖的三个目的:作为数据仓库的暂存区或源、作为数据科学家或分析师的实验平台,以及作为自助式商业智能的直接来源,如图1所示。

首先,大多数受访者强调了将数据湖用作数据仓库的暂存区或源的重要性。如前所述,暂存区是数据源与数据仓库之间的临时存储位置。一位受访者的以下引述说明了这一点:暂存区是一个存储[区域], ,通常为关系型数据库,用于在通往数据仓库的过程中临时保存源数据的副本。在扩展中,暂存区还用于在ETL流程中存储计算和转换产生的临时结果集。[暂存区]的主要目的是避免在通往数据仓库的数据转换过程中对源系统造成繁重处理和潜在过载,从而影响对业务至关重要的源系统。[…]数据湖是一种存储[区域,用于永久保存各种类型的源数据,包括结构化和非结构化数据。数据湖的主要目的是既满足当前已定义的需求,也满足[未来尚未定义的]需求。数据湖中的数据以其被抽取时的原始形式存储,保持与源系统或接收时相同的数据结构,不进行任何转换。

其中一位受访者指出了暂存区的一个缺点。他表示:当物联网和传感器发挥作用时,你需要一个地方来存储来自新技术的各种数据。[…]为了能够存储这些数据,可以使用SQL等关系型数据库不适合此用途。然后,数据湖应运而生,其唯一目的就是存储来自中间事物(如传感器设备和网络日志)的非结构化数据或异常数据。

其次,几位受访者谈到使用数据湖来存储历史数据或进行归档。他们解释说,数据湖还可以用于将归档数据从数据仓库中卸载。因此,所有受访者都认为,数据湖是任何数据仓库架构中有用的组成部分,并且可以被视为商业智能概念的一种延伸。

许多受访者还指出了数据湖在数据科学和高级分析方面的用途。根据大多数受访者的说法,数据科学家和业务分析师是数据湖的“核心用户”。受访者还指出,数据湖对于探索和高级分析很有用。例如,一位受访者表示:“我认为,你可以直接在数据湖中进行分析,当你找到一些优质数据,或者数据科学家开发出非常优秀的算法或模型时,就应该将该算法的结果移入数据仓库,并通过数据仓库生成报告。” 另一位受访者指出:

当你从数据仓库中获取一些数据时,我们已经对数据应用了大量的规则,比如转换规则。而在应用这些转换规则的同时,我们也相当于给数据做了“化妆”。[…]因此,这也意味着某些信息可能会丢失,例如,在某个属性上,源数据中存在缺失值,但在处理过程中,我们对其进行了清洗,使其变成了零而不是缺失。对于数据科学家或分析师来说,这类信息可能非常具体且重要,因为“缺失”可能意味着客户从未被询问过,而“零”则可能表示客户被询问过但回答了“否”。因此,这类信息在翻译过程中可能会丢失。为了避免信息[在转换中]丢失,最好有一个可以追溯的源,并在此基础上从头构建业务规则。

受访者还指出,数据科学家和分析师可以利用数据湖进行研发。正如一位受访者描述的那样:数据科学家在数据湖中还可以做其他事情。你可以进行实验,类似于研发,这样可以更具体地了解数据,在将数据请求或导入数据仓库之前,也能更加熟悉数据。[…]因此,例如,在明确具体的转换规则之前,数据科学家可能会对数据有更深入的了解。

此外,受访者指出,数据科学家通常从其本地工作站执行R脚本,以在数据湖上进行探索性数据科学和高级分析。因此,其中一位受访者表示:“我认为数据湖实际上是为数据科学家和分析师提供的一个沙箱。他们用它来进行数据探索和模型开发。” 最后,几位受访者提到,数据湖可以作为自助式商业智能的直接来源。其中一位受访者指出:“如果你需要一份新报告,那么我们可以直接在数据湖上构建。[…]因此我们直接在数据湖上使用自助式‐服务BI,同时结合数据仓库一起使用。我们在数据湖和自助式BI工具之间应用了一个语义层。” 一些受访者还解释说,数据湖可用于为商业智能报告和分析工具提供数据。

示意图0

4.3. 数据湖的挑战

访谈还揭示了与数据湖相关的若干挑战,包括数据管理、数据治理、分析所需的技能、数据质量以及数据检索方面的挑战。

首先,大多数受访者指出数据管理是数据湖最重要的挑战之一。其中一位受访者表示:“[数据湖]所缺乏的是数据管理 […] 了解这些数据是什么非常重要。即使是非结构化数据也可以被导入其中。但如果点击流数据进入其中,那么应明确定义这是网站级别的。” 受访者还认为数据治理是数据湖面临的挑战之一。其中一位受访者指出:“你仍然可以设置权限之类的东西;然而,许多公司会说‘好的,我们会把所有数据都迁移到这个数据湖中’,很快就会出现的情况是,没有人真正知道里面有什么。” 此外,一位受访者指出:“如果你需要治理,那么你需要将数据转移到因蒙或金博尔数据仓库中。” 该受访者认为,那些需要保护和模糊化机密数据的企业,在数据湖中实施数据治理可能会面临困难。

另一个挑战涉及在数据湖中进行数据分析使用所需的技能。其中一位受访者指出:
问题在于,数据的原始格式往往非常复杂,难以理解。因此,在准备数据 […] 时,对专业知识和高水平能力的要求更高。这意味着分析师或数据科学家必须非常擅长编写代码和处理数据。

大多数受访者也认为数据质量是一个重要挑战。其中一位受访者表示:“因此,在数据质量方面也会存在一些挑战[在数据质量方面的挑战], 。我的意思是,这不仅仅是向数据科学家提供数据的问题。[…]如果传感器出了问题,而你却期望该传感器能提供正确数据,那么后续的一切都会出错。” 此外,另一位受访者指出:“数据湖中的数据只是原始的[…]这些数据可能看起来非常不干净,并且其中可能存在大量垃圾数据。”

最后,数据检索提出了与数据湖相关的另一个挑战。一位受访者解释道: 数据湖与数据仓库之间的区别在于,在数据仓库中,你会在将数据存储到数据仓库之前对其进行转换。你提前完成所有工作。⋯.对于数据湖,你的数据是以原始格式存储的,因此为了获得洞察,你需要在之后进行处理。所以,在这种情况下,你只需要⋯.提取所需的数据,并编写一个程序来根据特定目的对数据进行清洗、标准化或整合。这意味着每次使用数据时都需要做大量工作,因为没有任何预处理是提前为你完成的。

大多数受访者认为,数据湖技术在数据获取过程中涉及的工作量较少,但在数据检索过程中工作量较大。

5. 讨论与对未来工作的启示

在本节中,我将讨论本研究最重要的发现。受访者强调了数据湖的三种用途:作为数据仓库的暂存区或源、作为数据科学家和分析师的实验平台,以及作为自助式BI工具的直接来源。

首先,大多数受访者认为,将数据湖用作数据仓库的暂存区比使用关系型数据库更为合适。传统BI利用暂存区的概念来整合来自多种数据源的数据,从而降低对数据源的依赖性,并减少因不同数据源的数据未同步更新而对决策过程造成的冲突[25]。数据湖与传统的关系型数据库暂存区非常相似,但有一个关键区别:数据湖可以存储结构化和非结构化数据(例如来自传感器设备、网络日志、点击流或社交媒体的数据),而关系型数据库则无法做到这一点。使用关系型数据库会导致数据建模不足、横向扩展性受限以及处理大量数据时的问题[26]。有两个趋势凸显了关系型数据库的局限性:一是由用户、系统和传感器产生的数据量呈指数增长,二是互联网、社交网络和网页加速了数据之间的相互依赖性和数据复杂性。数据湖能够从任何数据源摄取任何类型的数据,且无需预先定义数据结构或关系[27]。在这方面,我认为数据湖可以减少数据仓库的存储需求,同时还提供实用功能。

与它们存储的数据相关。这意味着数据湖不仅可以提供大量多结构化数据的存储,还能发挥更多作用。因此,未来研究需要探讨数据湖如何在成本、功能和实施方面替代并改进常规暂存区。

此外,我还发现数据湖和数据仓库通常共存。数据仓库具有诸多好处:它们为用户节省时间,提升信息的数量和质量,支持决策,改进业务流程,并助力实现战略业务目标[28]。数据仓库提供治理、可靠性、标准化和安全性;然而,实施传统的数据仓库需要进行耗时且复杂的数据摄取流程,可能需要数月才能看到输入数据的结果。在此背景下,数据湖能够提供敏捷性、灵活性、快速交付和数据探索的好处,以补充数据仓库的不足。我认为,利用数据湖技术有助于改善企业的数据仓库环境,并实现敏捷商业智能。因此,未来的实证研究应考察当前市场上可用的数据湖技术范围,并探讨如何利用数据湖扩展数据仓库环境,提供敏捷商业智能。

其次,我发现数据湖还作为数据科学家和分析师的实验平台。“数据科学家是那些懂得如何从当今信息泛滥的非结构化信息中挖掘出重要业务问题答案的人”[29] (第73页)。根据达文波特和帕蒂尔[29]的说法,数据科学家和分析师在决策阶段密切合作。大多数受访者认为数据科学家和分析师是数据湖技术的核心用户。根据文献记载,数据湖旨在作为数据科学家的“沙箱”[30]。数据科学家和分析师从数据湖中获益最多,因为他们具备理解数据内容、结构和格式所需的技能。以原始形式获取的数据通常不适合直接用于分析;这些数据往往难以获取、解释、描述和维护。因此,数据科学家和分析师需要通过逐步流程将原始数据准备用于分析目的[12]。此外,我们的研究结果表明,将数据湖用作实验沙箱可能至关重要。因此,我建议未来研究应更详细地探讨这些问题。

最后,数据湖可以作为自助式商业智能的直接来源。然而,这一主题在文献中并未讨论。访谈也未提供明确描述此目的实施的信息。因此,需要未来研究来探讨数据湖的这一用途。

我还发现,数据湖方法最重要的感知收益包括:减少前期数据存储工作、更好的数据获取、快速访问原始数据以及数据保存。这些好处使企业能够跨各种源移动数据,从而快速获得业务成果。我认为,数据湖技术可以扩展传统BI系统,以满足更广泛的业务需求。因此,我建议商业智能文献应更详细地探讨数据湖在商业智能实施中的好处,以及数据湖部署对业务的好处。

与其他技术一样,数据湖也面临某些挑战。通过专家访谈,我发现了与数据湖相关的若干挑战。这些挑战涉及数据管理、数据治理、分析所需的技能、数据质量以及数据检索。数据湖是用于存储和分析结构化和非结构化数据的技术的进一步发展。然而,它们代表了一种复杂解决方案;因此,数据湖实施的挑战需要在文献中得到更多关注。

6. 结论

本文研究了数据湖在企业中的能力。通过一项探索性研究,了解了数据湖技术,并揭示了数据湖的感知收益和目的。研究发现,数据湖能够与多种数据源和数据仓库无缝集成。尽管数据仓库继续满足用户的信息需求并为企业提供重要价值,但数据湖为数据科学家、分析师和自助式数据使用者提供了丰富的数据来源,同时也满足了商业智能和大数据的需求。本文对商业智能文献做出了三项贡献:数据湖被用作数据仓库的暂存区;数据湖作为数据科学家和分析师的实验平台;数据湖可作为自助式商业智能的直接来源。归根结底,数据湖并不取代数据仓库,而是增强或补充数据仓库架构。因此,应将数据湖视为数据仓库的扩展。

商业智能架构。该研究还确定了与数据湖相关的若干挑战。更深入地了解这些挑战,有助于希望开展数据湖项目的组织。

与任何研究一样,本研究也存在一些局限性。尽管这项探索性研究借鉴了在数据湖方面具有知识和经验的专家,但这些专家仅来自大型企业。因此,所有结果均基于大型企业专家的经验。此外,本研究仅代表一项探索性研究,因此其普遍性有限。然而,尽管存在这些局限性,本研究的发现仍可为未来关于数据湖的实证研究提供重要的输入。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐