为什么数据很多、技术很强,数据仍然难以流通?

作者:刘新海

在今天的数据经济发展中,更稀缺的往往不是再找到一种处理数据的方法,而是建立一套让不同机构、监管者和公众都能理解并接受的解释框架。

近日参加一项多家知名机构联合参与的可信数据空间课题的中期评审,我看到报告用了大量篇幅介绍技术架构、技术路线和技术难题。技术工作当然重要,但读完之后,一个更基本的问题仍然没有得到充分回答:我们究竟要解决什么问题?

这些年,中国积累了海量数据,也形成了相当强的技术能力。从接口、加密到隐私计算,数据在不同机构之间传输和处理,早已不是一个完全无法解决的技术难题。可是,在许多真正需要数据的场景里,数据依然很难流通;即使接通了,也未必能持续使用。

原因在于,“数据流通”表面上是数据从一处到另一处,背后却是不同主体之间的权利、利益和责任重新安排。技术能帮助执行安排,却不能代替各方就安排本身达成共识。

一、先问一句:数据为什么要流通?

讨论数据流通时,我们常常默认“流通越多越好”。但数据不是水,也不是所有数据都需要汇入同一条管道。

以金融征信为例,银行需要信息,是为了更准确地判断风险,向合适的客户提供信贷服务。对于缺少传统信贷记录的人,支付、电信等数据在特定条件下可能提供补充信息。但这并不意味着,只要一种数据有助于预测风险,就应当被采集、共享和用于授信。

还必须继续追问:它是否足够准确?是否与当前用途相称?个人是否知道它会如何影响自己?错误能否纠正?由此产生的收益和风险落在谁身上?

如果没有回答这些问题,“促进数据流通”就容易从实现公共和商业价值的手段,变成一个自我证明的目标。平台建起来了,接入量上去了,却可能没有改善金融服务。

二、数据流通不畅,至少有四种不同的原因

第一种是不敢流通。机构担心使用依据不清、授权链条不完整,或发生泄露和滥用后责任难以划分。此时需要的是清晰、可执行的规则,而不仅是更安全的传输工具。

第二种是不愿流通。掌握数据的机构承担采集、清洗、维护和合规成本,也可能担心客户关系与竞争优势流失。如果分享之后得不到合理回报,或者只能承担风险,很难期待它长期提供高质量数据。

第三种是流通之后不好用。数据的定义、质量和更新频率不一致,机构拿到数据也无法可靠解释。这时技术标准和数据治理确实关键,但首先要明确具体业务场景需要什么,而不是先把所有数据接进来。

第四种是相关的人不信任这种使用。尤其对个人数据而言,人们担心的不只是泄露,还包括数据被用于自己不知道的目的、错误信息影响贷款,以及无法知道谁作出了决定。仅仅证明数据在传输过程中“看不见”,并不能回答这些疑虑。

这四类问题相互关联,解决路径却不相同。把它们统称为“技术难题”,项目就可能一直在升级技术,却始终触及不到流通的真正障碍。

三、可信数据空间首先需要建立“规则上的可信”

可信数据空间提供了一个重新设计多方协作的机会。国家数据局将其描述为基于共识规则、连接多方主体、实现数据共享共用的基础设施和价值共创生态。这一定义中的“共识规则”和“价值共创”,与技术能力同样重要。

一个空间里可以有身份认证、使用控制、日志和审计,但仍需回答:谁制定准入规则?什么用途可以被批准?数据提供者能否限制后续使用?个人如何查询和提出异议?运营者出了问题承担什么责任?贡献和收益如何衡量?

这些问题没有讲清楚,技术上的“可信”就难以变成机构愿意参与、个人能够理解、监管可以监督的信任关系。相关行动计划也要求建立权责清单、全过程管理制度和公平透明的收益分配规则。

更重要的是,可信数据空间要证明自己相对于现有方式的必要性。金融征信领域已有报送、查询、授权接口和机构间合作机制。在哪些场景下,这些方式已经足够?又在哪些场景下,多方持续协作确实需要一个共同的规则与运营环境?如果不作比较,就很难判断新建空间是在解决问题,还是增加一层系统。

四、个人数据尤其不能只从机构视角设计

个人数据流通的困难,还有一个容易被忽略的方面:消费者往往是信息主体,却不是规则的主要设计者。

在一些业务流程中,授权被处理为点击、签字和留痕。形式上完成了交互,个人却未必真正理解数据的来源、用途和后果。另一方面,如果每次使用都要求复杂、重复的授权,消费者体验和业务效率又会受到影响。

因此,研究个人数据流通,不能停留在“要不要授权”的二选一问题上。更值得研究的是:如何让用途足够具体、告知足够清楚、使用可被核验、越界可以追责、错误能够纠正。征信领域尤其如此,因为数据的使用可能直接影响一个人的融资机会。现行征信业务规则对个人信用信息采集的同意和目的告知已有要求,新的流通机制必须在这些规则之内设计。

让个人获得更有效的知情和控制能力,也并不等于要求个人理解每一个技术细节。制度和产品设计的责任,是把复杂的数据处理转化为人能够作出判断、事后能够寻求救济的安排。

五、从征信发展看,理论为什么比技术清单更重要

我自己是做技术出身的。正因为长期研究技术,也长期观察征信体系的运行,我越来越感到:技术解决的是“怎样做”,理论首先要回答“为什么做、在什么条件下有效”。

征信的发展就包含一系列这样的基本问题。信息不对称解释了信贷机构为什么需要借款人信息;数据共享解释了为什么单家机构掌握的信息不足以判断风险。但这只是起点。共享什么数据、由谁提供、各方为什么愿意参与、错误由谁纠正,都需要进一步回答。

经验和统计同样有价值,也有边界。传统信贷经验是在特定产品、客户和经济环境中形成的。当新的客户群体和金融产品出现时,过去有效的判断未必仍然适用。大数定律也不能被简单理解为“数据越多,结论越可靠”:样本是否有代表性、数据如何产生、结果是否能够验证,决定了统计规律能否用于眼前的决策。

更关键的是信息闭环。征信机构和信贷机构不能只不断增加数据输入,还需要持续观察授信之后的结果,识别判断失误,纠正错误记录,调整模型与规则。没有反馈,所谓的数据流通可能扩大信息供给,却未必提高信用判断的质量。

这些问题看似是理论,实际上决定了系统的架构、数据的选择、机构的分工和监管的重点。理论不是技术建成之后的解释,而是决定技术应该朝哪里建设的依据。今天研究可信数据空间,也应当从这样的基本问题出发:它能否减少有害的信息不对称?能否形成可持续的数据共享?能否让数据使用者获得可靠反馈?如果答案还不清楚,就不宜急于把技术路线当作研究结论。

小结

我自己从技术研究起步,深知技术突破的价值。但在今天的数据经济发展中,更稀缺的往往不是再找到一种处理数据的方法,而是建立一套让不同机构、监管者和公众都能理解并接受的解释框架。

理论决定我们如何认识问题;对问题的认识决定战略;战略最终决定建设什么,以及什么不必建设。

所以,面对“数据很多、技术很强,数据仍然难以流通”这个问题,我们应当先放慢一步:选定一个有价值的场景,把参与者、使用目的、权利边界、收益分配、风险责任和救济路径讲清楚,再判断需要什么技术。

当这些问题能够被公开讨论、被具体回答,并在实践中接受检验,数据流通才可能从“接通了多少系统”,走向“持续创造了多少可信的价值”。

发表评论

邮箱地址不会被公开。 必填项已用*标注