9月18日,有开发者发现智谱ZCode在默认开启"代码库索引"功能的情况下,会将用户的工作区和完整的Git历史资料上传至云端。对此,智谱表示歉意,称该功能仅用于生成Repo Wiki,并承诺在页面生成后会立即销毁上传的数据。然而,这一事件的严重性远不是智谱所描述的那样轻松。它不仅是一次简单的操作失误,更体现出产品功能配置中的潜在风险,这样的解释显然低估了事件的影响。
在这起事件中,智谱应当承担首要责任,因为用户在使用其产品时,上传的内容、客户端的读取权限以及功能的默认设置,均由智谱控制。即便问题源于某个开源组件或外部承包团队,智谱依然不能将责任推卸给代码的来源。更为严重的是,ZCode上传的并不是用户主动选择提交给模型的特定代码,而是包括整个项目的工作区以及完整的Git历史。这其中,不仅含有当前的源码,还可能包括尚未公开的功能、已被删除的文件、本地分支、提交者的信息,以及开发者曾经泄露但已删除的密钥。对于一家软件公司而言,这几乎相当于暴露了其整个研发过程、产品规划及内部资产。
这意味着,用户提供给模型的数据实际被用于训练智谱自身的模型。如果某企业的员工使用智谱的Coding模型,那么该公司的机密信息,包括核心代码,都可能在智谱的模型中暴露。然而,用户在此之前可能并未意识到自己的数据已经离开本地。因此,智谱宣称已删除数据,无法平息争议。一旦数据上传,控制权便转移,用户无法确定其是否进入了日志、缓存或备份中,是否经过其他系统的处理,甚至是否被内部人员接触,或后续是否逐步用于数据清洗与模型训练,这些都无法由用户通过客户端加以验证。
与业内人士交流后了解到,大模型的训练数据主要分为两类重要内容,这也再一次突显了数据安全问题的复杂性与敏感性。