数据世界
产业资讯 宏观经济 企业动态 人物动态 科技数码 数据洞察 AI前沿 行业峰会 热点资讯

权威认可!天翼云数据库论文被EDBT收录

2024-10-16来源:数据世界编辑:芳华

近日,由天翼云数据库团队、中国电信云计算研究院和深圳北理莫斯科大学合作完成的《Taste: Towards Practical Deep Learning-based Approaches for Semantic Type Detection in the Cloud》(构建云上基于深度学习的大规模语义类型识别系统)论文被28th International Conference on Extending Database Technology(EDBT)长文收录。

EDBT是数据库领域的知名国际会议,也是中国计算机学会CCF推荐的重点学术会议,已连续举办27届,近五年平均录取率仅为20.8%。此次天翼云数据库产品线所著论文被EDBT收录,代表着天翼云的科技创新能力再次获得数据库工业界和学术界的权威认可。

该论文专注于数据管理系统中的语义类型检测(Semantic Type Detection)问题的研究,并在检测性能和安全性方面实现了突破。语义类型可以显示出复杂数据的语义含义,如人名、地址、身份证号等,不仅能够帮助人类更好地理解数据,还能辅助数据管理系统提供搜索、转换和清洗等一系列关键服务,例如:数据管理系统识别出“身份证号”这一语义类型后,可将该数据标记为敏感信息,进而智能地提供数据脱敏服务。

然而,现有语义类型检测技术在每次检测时都需要扫描数据列中的具体内容,存在着两个显著弊端:一方面,扫描数据列会极大增加额外的I/O和网络开销,降低检测效率,还可能对云用户的业务产生不利影响;另一方面,扫描数据列本身耗时较长,加之基于数据列进行特征提取和推理,进一步增加了模型的处理时间,导致整体检测效率较低。伴随AI技术的迅猛发展,采用深度学习来实现语义类型检测的研究日益增加,虽在检测成功率方面取得巨大进展,但仍难以满足云环境下的大规模语义类型识别。

两项创新检测技术  实现高效精准检测

作为云服务国家队,天翼云坚持核心技术自主攻关,针对现有语义检测技术的不足,该论文创新性提出两阶段语义类型检测框架(Two-phase semantic type detection framework,简称为Taste)。

Taste框架的整体执行流程可分为两个阶段(如图1所示):第一阶段,仅利用数据源的元数据(如表名、列名、列注释等)进行初步快速的语义类型检测,以减少对数据源的扫描操作;第二阶段则是按需进行,在需要进一步确认第一阶段中不确定的语义类型时,再将列内容与元数据结合起来,完成更精确的检测。

通过两个阶段的结合,Taste不仅有效提升了检测效率,减少了对用户数据源的影响,还可在元数据质量不佳的情况下保持系统较强的鲁棒性。同时,Taste具有较强的灵活性,云上租户可根据自身的数据隐私需求选择完全禁用第二阶段,从而进一步保护数据。此外,Taste通过将每个阶段划分为数据准备和语义推理两个步骤,并利用流水线机制并行执行不同的步骤,充分利用I/O、CPU和GPU资源,显著提升了整体执行效率,可更好地适用于云环境下海量数据表和列的处理。

图片 1.png

图1 两阶段语义类型检测框架概览图

此外,该论文进一步设计了一种新颖的非对称双塔检测模型(Asymmetric Double-Tower Detection,简称 ADTD),通过引入多任务学习来支持Taste的两阶段检测过程。ADTD模型结构分为metadata塔和Content塔(如图2所示),前者是对元数据特征进行编码,后者是结合元数据信息对列内容特征进行编码。在Taste的两阶段检测中,第一阶段仅利用metadata塔进行推理,并将metadata塔加入到缓存中,供第二阶段使用,以减少重复推理;第二阶段则是结合metadata塔的缓存和Content塔进行推理。在训练过程中,两个阶段的输出可以结合在一起做多任务学习,使得模型只需训练一次,即可应用于两个阶段的推理过程。

图片 2.png

图2 非对称双塔检测模型结构图

该论文的实验表明,Taste 框架在执行效率、准确性、降低数据列扫描侵入性等多个方面均表现优异,且在不同的数据隐私设置下表现出较强的鲁棒性,并具备云端大规模部署的潜力。

目前,Taste框架已在天翼云数据管理服务(DMS)进行落地。天翼云DMS是TeleDB的一款数据库工具产品,作为一站式数据生命周期管理平台,其支持多云异构数据库统一纳管,提供数据资产管理、客户端工具等功能。依托Taste框架的性能优势,天翼云DMS可帮助客户进行高效、灵活的语义类型检测,实现更加快捷且智能化的敏感数据识别,显著提升云端数据管理的安全性和稳定性,为企业充分释放数据价值提供有力支撑。

科技创新是发展新质生产力的核心要素。面向未来,天翼云将秉持央企使命责任,发挥数字中国建设主力军作用,持续推进数据库等云计算技术攻关,筑牢国云智算底座,以科技创新引领产业发展。

SK海力士新DDR5芯片“X021”亮相:或适配Intel未来处理器,原生频率达7200MT/s
快科技10月22日消息,SK海力士的全新DDR5内存芯片近日在网络上出现,据称代号为“X021”,并带有新的零件编码“AKBD”。 根据unikoshardware的说法,芯片上的“X021”标记表明它是第二…

2025-10-22

魔方网表,以技术为本,坚定的长期主义者
全球数字化的汹涌浪潮推着各行各业不断向前,商业世界正在以前所未有的速度与频率经历巨变。对此,企业如何快速有效地在日益复杂的市场环境下,抓住自身的发展机遇,是各行各业的急需解答的难题,而数字化转型又成为其中的必修之课。然而,对很多企业来说,快速变化的业

2025-10-22

售价13000元!三星Galaxy XR头显发布 直面苹果Vision Pro高端之争
【CNMO科技消息】10月21日,三星正式发布了其首款混合现实头戴设备——GalaxyXR,官方售价定为1799.99美元(约合人民币13000元),直接瞄准了苹果Vision Pro的高端市场。借助头显的…

2025-10-22

性能与美学的双重盛宴:iQOO 15的自我修养与突破
前面我们详细聊过,它把一块自研电竞芯片Q3塞进机身,像给手机装上一块真正的“独显”,再辅以双轴马达、对称大师双扬和一位随时陪练的AI军师——这一次,性能旗舰的终点不再是冷冰冰的跑分,而是指尖、耳朵,甚至心脏都…

2025-10-21

国家广电总局首颁“便捷看电视”认证,认准标志选电视享便捷观影体验
IT之家 10 月 20日消息,国家广播电视总局今日宣布,国家广播电视总局广播电视规划院为首款符合认证标准的智能电视机颁发“便捷看电视”认证证书。这款率先通过认证的产品由康佳研发打造,即将正式上市销售。 作…

2025-10-21

2025上半年全球智能眼镜出货增64.2%,2029年或破4000万台中国增速居首
【环球网科技综合报道】10月21日消息,市场研究机构(IDC)发布报告显示,2025上半年,全球智能眼镜(AI眼镜)市场出货量达406.5万台,同比增长64.2%。 IDC预计,到2029年全球智能眼镜市场出…

2025-10-21

牌面拉满!比亚迪成为多国元首的选择
近年来,我国新能源汽车产业在科技创新驱动下实现跨越式发展,比亚迪作为行业领军企业,技术领先全球瞩目,凭借过硬的技术实力与产品品质,赢得多国元首青睐,成为“中国制造”向“中国智造”转型升级的典型代表,更成为传递中国科技实力的“移动新名片”与“无声外交官

2025-10-21

IDC报告:百度智能云智算服务市场份额第一,GenAI IaaS增速最快
10月21日,国际权威咨询机构IDC发布了《中国智算专业服务市场(2025上半年)跟踪》报告。其中,在智算解决方案实施服务市场中,百度智能云以19.9%的份额位居第一;在GenAI IaaS领域,百度智能云实现近5倍增长,增速位居市场首位。随着大模型及AI应用的爆发,云计算正在以C

2025-10-21

抖音电商持续治理虚假宣传保健功效,清退违规达人4.3万名,违规商家793家
10月20日,抖音电商安全与信任中心发布治理虚假宣传保健功效的进展,公告称多平台反复出现以“健康焦虑”为卖点的功效虚假宣传现象,已成为食品行业的顽疾。据了解,部分不良商家、达人将普通食品包装为“保健品”或“特医食品”,甚至将保健食品夸大为具有医疗功效,损

2025-10-21