在生成式人工智能模型领域率先取得重大进展的西方国家有关业界,将被这类模型处理的信息估量之最小单元(基元)称为token,借以估算模型的有效工作量,以及工作效能(单位时间有效工作量上限)。
token不是严谨计量单位,而是对被处理信息进行切分的最小估量单元。计量单位属衡量标准范畴,最小估量单元属被估量对象切分单元范畴。
token主要用于上述模型的技术经济分析场合,如算力出租计费,以及模型项目投资效益评估。当前全球存在多种人工智能模型。不同性能的模型对“被处理信息估量基元”的切分方式各有所异。这方面尚无统一的国际规范。所以不同模型对同一信息内容(比如同一张图片)作同样效果的处理,对被处理信息量的估算值各不相同,甚至有不小差异。
我国计算机科学技术名词审定委员会为被上述模型处理的信息估量基元取名“词元”。对此,有不少人表示同意。
但也有不少人认为用“词元”作此命名不太贴切,因为人工智能模型处理对象不仅是文本类的,还有音频、图像、位置坐标、数值、量纲等多种类型,而“词”的语义覆盖面偏窄。这看法有其合理性。
相信上述委员会专家的专业素养是很高的,但纵然专家思考周全,亦难免偶有疏漏。大家就事论事,据理讨论和建言就好。
在上述分歧未弥合的情况下,目前国内仍大量使用着token这个外文原词,甚至上述模型的业界人士和主流媒体人士在非正式文件撰写或报道中也是如此。这种状况不利于中文优势的发挥和中文术语体系的构建,也不利于国内这类模型的应用推广和发展。由于生成式人工智能模型正在引发世界新一轮产业革命浪潮,影响广泛而深远,在此浪潮中,指代“被处理信息估量基元”的名称成为重要的高频用词,所以其中文定名是应予高度重视的事情。
按照合理的定名惯例,对于我国独立或参与严谨定义的计量单位,宜直接依语义作中文定名。
对于来自国外有严谨定义的计量单位名称,宜音译,其原因众所周知。若特需意译或直接依语义命名,宜避免用“元”字,因为严谨的计量单位序列只有“基本计量单位”概念,没有“最小计量单位”概念,而在大量现有科技术语当中,“元”常用来表示最小划分单元。例如长度基本计量单位metre不译为“长元”或其他“×元”。
而没有严谨定义的估量单位,属不严谨衡量基准范畴,其名称宜依语义而定或意译,如“把”“块”“串”等。
至于没有严谨计量定义的“被估量对象最小切分单元”,如“被处理信息估量基元”,属被估量对象不严谨细分单元范畴,其名称也宜依语义而定或意译,特别之处在于可用甚至宜用“元”字,取其“最小单元”之意。
在上述模型业界语境中,若依语义对“被处理对象信息估量基元”的现有中文名称“词元”作修改,且保留“元”字,只需斟酌如何替换“词”字即可(“词”字不适用的原因详见前文第六自然段)。
这里建议将“词元”修改为“信息量元”,该名称在上述模型业界语境中,可确切指代“被处理对象信息估量基元”。此举以字数增加两个为代价,换取该名称含义更贴切。