Tokenizer的终局:无token化技术与大语言模型的架构重构——基于BLT、LangFlow与动态词汇生成的技术演进与3–5年落地预判(世毫九实验室原创研究)
作者:方见华
单位:世毫九实验室
引言
在人工智能技术快速演进的今天,一个看似微不足道却至关重要的技术细节正在经历根本性变革——Tokenizer(分词器)。作为连接人类自然语言与机器理解的桥梁,Tokenizer长期以来被视为大语言模型的必要组件,然而,这一看似理所当然的技术架构正面临前所未有的挑战。从更宏观的文明视角来看,无token化不仅是一项工程优化,更是人工智能从符号处理迈向连续语义理解的关键一步,为碳硅共生时代的到来提供了技术底座。
2025年世界人工智能大会(WAIC)上,上海交通大学副教授、John Hopcroft计算机科学中心副主任林洲汉的一番话引起了业界的广泛关注:"目前学术界已经有成熟架构落地了,只差大厂投入资源做大模型规模化商用!" 这一判断直指无token化技术的发展现状——理论突破已经完成,产业化进程即将开启。
回顾Tokenizer的发展历程,从2013年Word2Vec和GloVe的词级分词,到2015年BPE算法的引入,再到2018年WordPiece和SentencePiece的兴起,直至2021年ByT5等字节级模型的出现,这一技术演进的轨迹清晰地反映了一个根本性矛盾:离散化处理与连续语言本质之间的冲突。正如研究者所言,"语言本身是连续的、复杂的、充满歧义的。但对计算机而言,它只能处理离散符号和向量运算"。
当前,这一技术瓶颈正在被无token化技术逐步突破。Meta AI发布的Byte Latent Transformer(BLT)架构首次实现了在同等规模下与基于词元模型相当的性能,同时显著提升了推理效率和鲁棒性。伊利诺伊大学提出的LangFlow框架则在连续扩散领域取得突破性进展,首次让连续扩散真正追上甚至在某些任务上超越了离散扩散的水平。
本文将深入分析Tokenizer作为经典AI时代过渡产物的历史定位,系统梳理无token化技术的三大核心路线——直接字节处理、连续隐状态建模和动态词汇生成,并追踪主要科技公司和学术机构在这一领域的最新进展。通过技术演进、商业落地、学术研究和行业影响等多维度的分析,我们将论证一个核心判断:3-5年内,无token化技术必将成为主流,彻底改变大语言模型的技术架构和应用模式。
一、Tokenizer的历史定位与根本局限
1.1 Tokenizer的技术演进轨迹
Tokenizer的发展历程本质上是一部在"词汇表大小"与"序列长度"之间寻找最优平衡点的进化史。这一演进过程可以清晰地划分为三个阶段:
规则与统计时代(1980s-2010s)标志着Tokenizer技术的起步。在大模型出现之前,分词(特别是中文分词)是自然语言处理中一个独立且至关重要的任务。基于规则的方法依赖人工编写的词典和语法规则,最典型的是最大匹配法,即从左到右或从右到左,在词典中寻找最长的匹配词串。然而,这种方法存在明显局限,无法识别未登录词(新词),难以处理歧义问题,如"南京市长江大桥"的切分困境。
随后,基于统计的方法开始兴起,利用机器学习算法如隐马尔可夫模型(HMM)、条件随机场(CRF)计算字与字之间结合的概率。如果两个字经常连在一起出现,它们构成一个词的概率就高。Jieba分词就是这一时期的集大成者,它融合了"基于前缀词典实现动态规划"和"HMM模型识别新词"两种方法。
子词革命(2010s-2020s)的到来标志着Tokenizer技术的重大突破。随着深度学习的发展,研究者发现"按词分"会导致词汇表爆炸(无法处理生僻词),"按字母分"会导致序列过长(丢失语义)。子词(Subword)算法应运而生,成为现代大模型的基石。
2015年,BPE(Byte Pair Encoding,字节对编码)算法被Sennrich等人引入神经机器翻译领域,首次解决了未登录词问题。其核心逻辑是基于频率的贪心算法:初始时将所有文本拆分为字符,然后反复合并出现频率最高的相邻符号对,直到达到预设的词汇表大小。
2018年,Google在BERT中广泛使用的WordPiece算法采用了不同的策略,它不是基于频率统计,而是选择合并后能最大化训练数据似然概率的词对,引入了"##"前缀来标记子词后缀,更倾向于保留语义完整的单元。同年,Kudo提出的SentencePiece框架彻底打破了"先分词再建模"的传统,直接对原始字符流进行建模,空格也作为token学习,支持BPE和Unigram Language Model两种模式。
字节级与多语言融合(2020s至今)代表了当前的技术前沿。为了解决"未登录词"(OOV)和多语言支持问题,分词器进化到了字节级。2019年,GPT-2首次引入Byte-level BPE,将文本视为UTF-8字节序列(0-255),而不是字符序列,彻底解决了未登录词问题,无论输入什么语言(甚至乱码、Emoji),都能被拆解为字节组合。
1.2 离散化处理的根本困境
尽管Tokenizer技术在不断演进,但其根本性缺陷却始终存在。正如最新研究指出,"Tokenization underlies every large language model, yet it remains an under-theorized and inconsistently designed component"。这一判断揭示了一个令人深思的事实:作为每个大语言模型的基础组件,Tokenizer却缺乏充分的理论支撑和一致的设计标准。
静态词汇表的固有瓶颈是最直接的问题。固定词表(如5万)无法处理生僻词、新词、多语言、符号、代码等情况。在形态丰富的语言中,这一问题尤为突出,如阿拉伯语单词往往包含多个语法和语义元素,传统tokenizer会将其过度切分为11个以上的子词单元,严重破坏了语言的内部结构。
强归纳偏置限制了模型能力上限。将连续语言硬切成离散token的过程破坏了语义连续性与长程依赖,这被认为是幻觉、推理断层、长文本理解弱等问题的重要根源。子词方法虽然在词汇表大小和序列长度之间取得了平衡,但它们基于频率统计的特性导致频繁形式主导,而罕见词、低资源语言和领域特定术语捕获不足,token边界往往反映统计伪影而非语言结构。
效率与成本的双重劣势进一步凸显了问题的严重性。传统tokenizer虽然能实现关键的序列压缩,并提供潜在有用的语义"捷径",却会导致模型脆弱性、语言偏见及流程复杂度增加。相比之下,字节级模型通过直接操作原始UTF-8数据,具备与生俱来的通用性与鲁棒性,能够处理任意语言的任意文本,且无未登录词(OOV)问题,对文本表面的细微变体也不敏感,但代价是序列长度显著增加。
1.3 学术界对Tokenizer缺陷的重新认识
近年来,学术界对Tokenizer根本性缺陷的认识发生了重大转变,这一转变不仅体现在技术层面的批判,更深入到了对整个AI架构设计理念的反思。
语言公平性问题成为新的关注焦点。最新研究揭示,tokenization可能对不同语言或身份群体造成不平等对待,形态丰富的语言经常遭受过度切分,延长序列并降低性能。基于token的商业语言服务定价模型放大了这些差异,导致非英语环境下成本更高、质量更低,对使用低效tokenization语言的用户造成了实质性的经济负担。
对噪声敏感性的认识深化。研究发现,当前tokenization方法的拼写敏感性揭示了一个关键缺陷,即它们不能充分模拟人类的阅读能力。另一个关键问题是当前tokenization方法缺乏长度感知能力。这意味着模型在面对轻微的拼写错误或格式变化时可能表现出剧烈的性能波动,严重影响了系统的实用性和可靠性。
计算效率的根本性挑战得到了重新评估。研究者指出,Transformer模型的自注意力机制必须处理3-4倍以上的token,显著降低了效率,且难以调试。更重要的是,tokenization错误会导致transformer模型无法正确将文本转换为数字token,表现为序列长度不匹配、特殊token冲突或tokenizer与模型之间的编码不兼容。
系统性影响的全面认识正在形成。现代LLM的核心流程几乎都是端到端的,唯独分词这一步是基于启发式规则预先完成的。这种方式虽然便于模型处理,但引入了多种局限性:领域敏感性导致特定领域(如医学、编程)的文本可能无法被通用分词器有效编码;噪声敏感性使得轻微的拼写错误可能导致完全不同的分词结果;正字法知识缺失使模型难以理解字符级别的模式和规律;多语言不公平现象在非英语语言,尤其是形态丰富的语言中表现得尤为明显。
二、无token化技术的三大核心路线
2.1 直接字节处理技术:从BLT到ByT5的突破
直接字节处理技术代表了无token化技术的最激进探索,其核心思想是彻底抛弃传统的分词器,直接对原始字节序列进行处理。这一技术路线的突破意义在于,它首次证明了无需预定义词汇表也能实现高效的语言理解和生成。
Meta AI的Byte Latent Transformer(BLT)是这一领域的里程碑式成果。BLT架构彻底改变了传统范式——它直接以原始字节为输入,无需任何预定义词表,却能在同等规模下达到与基于词元模型相当的性能,同时显著提升了推理效率和鲁棒性。BLT的核心创新在于它既能利用字节级信息,又能通过动态分组控制计算成本。
BLT的技术架构包含三个核心组件:轻量级本地编码器将输入字节编码为补丁表示;大型潜在Transformer处理补丁表示的主要计算单元;轻量级本地解码器将补丁表示解码回字节。这种三级架构设计允许模型在补丁级别高效分配计算资源,同时保留对字节级信息的访问。
BLT最关键的创新在于基于熵的补丁分组机制。它使用一个小型字节级语言模型来估计下一个字节的熵(不确定性):H(x_i) = Σ_{v∈V} p_e(x_i=v|x_{<i}) log p_e(x_i=v|x_{<i})。当熵超过设定阈值时,开始一个新的补丁。这确保了模型在信息密度高(预测困难)的位置分配更多计算资源。
为了增强对字节序列的表示能力,BLT引入了N-gram哈希嵌入技术。对于每个字节位置,模型考虑包含当前字节的多个长度(3到8)的N-gram,并通过哈希函数映射到嵌入空间:e_i = x_i + Σ_{n=3,...,8} E_n^hash(Hash(g_{i,n}))。这使模型能够捕获字符级别的模式,大幅提升了对字符组合的敏感性。
Google的ByT5则提供了另一种直接字节处理的实现路径。ByT5保留了T5和mT5的编码器-解码器Transformer主干,关键区别在于用纯字节级接口替换了子词tokenization前端。与大多数其他预训练语言模型(BERT、XLM-R、T5、GPT-3)使用子词词汇表不同,ByT5模型直接对UTF-8字节进行操作,无需任何文本预处理。
ByT5的技术特点包括:极小的词汇表包含256个UTF-8字节值以及少量特殊token;编码器与解码器的深度比例为3:1,以补偿因小词汇表节省的参数,并为处理原始字节输入提供更多容量;调整了隐藏层大小和前馈网络维度,以保持与mT5相似的总体参数数量;在预训练阶段对更长的字节跨度进行掩码(平均长度为20个字节),而mT5掩码的token跨度更短。
实验结果显示,ByT5在一系列任务中与参数规模匹配的mT5模型相比具有竞争力,在对噪声的鲁棒性、多语言基准测试性能、生成式任务性能,以及对字符或语音信息固有敏感的任务性能方面展现出显著优势。然而,其主要缺点是计算成本高,尤其在长序列任务中,推理延迟显著更高。
2.2 连续隐状态建模:从Coconut到LangFlow的创新
连续隐状态建模技术探索的是绕过离散token直接在连续空间中进行语言理解和推理的可能性。这一技术路线的革命性在于,它挑战了"语言必须被分解为离散单元才能被计算机理解"这一基本假设。
Coconut(Chain of Continuous Thought)是这一领域的代表性工作。Coconut是一种新的范式,使大语言模型能够在无限制的隐空间中推理,而不是局限于"语言空间"。其核心思想是利用LLM的最后隐藏状态作为推理状态的表示(称为"连续思维"),不是将其解码为词token,而是直接在连续空间中将其作为后续输入嵌入反馈给LLM。
Coconut的技术实现相对简单但意义深远。在传统的链式思维(CoT)中,模型生成推理过程作为词token序列,而Coconut将最后隐藏状态视为推理状态的表示("连续思维"),并直接将其用作下一个输入嵌入。这允许LLM在无限制的隐空间而不是语言空间中推理。
更重要的是,Coconut导致了一种高效的推理模式。与基于语言的推理不同,Coconut中的连续思维可以同时编码多个潜在的下一步,允许推理过程类似于广度优先搜索(BFS)。虽然模型可能最初不会做出正确的决定,但它可以在连续思维中保持许多可能的选项,并通过推理逐步消除错误路径,在某些隐式价值函数的指导下。
LangFlow框架则从另一个角度探索连续建模的可能性。这项来自伊利诺伊大学的研究提出了LangFlow框架,首次让连续扩散真正追上甚至在某些任务上超越了离散扩散的水平。LangFlow的突破在于解决了连续扩散长期面临的三个关键设计失误:
首先,研究团队将嵌入空间扩散与流匹配(Flow Matching)联系起来,为连续扩散建立了更扎实的数学基础。他们发现,嵌入空间扩散在数学上天然地和流匹配是同一回事,更进一步,他们把模型的训练目标(交叉熵损失)和布雷格曼散度联系了起来,证明了用交叉熵来训练嵌入空间扩散模型是理论上最正确的选择。
其次,LangFlow解决了噪音调度的问题。研究团队发现,在图像生成领域流行的均匀噪音调度方案并不适用于语言数据,因为文字的目的地是离散的词元——词汇表中的那几万个词是有限的"孤岛",即使在相当嘈杂的状态下,模型也常常能根据语义线索猜出正确答案。为此,他们引入了"对数噪信比"γ和"信息均匀原则",让每一步采样获得的信息量尽可能相等。
第三,LangFlow重新认识了自我条件化的作用。研究发现,在连续扩散中,自我条件化帮助模型在连续的嵌入空间中更好地校准方向,既提升了生成质量,也提升了概率估计的准确性。开启自我条件化后,LangFlow的PPL从49.0降到30.0,Gen.PPL从154.2降到81.5,改善幅度高达19个点。
2.3 动态词汇生成技术:zip2zip的创新实践
动态词汇生成技术采取了一种折中而务实的路线,它不完全抛弃token概念,而是让词汇表在推理时动态扩展,从而在保持效率的同时解决传统tokenizer的局限性。
zip2zip技术是这一领域的典型代表。zip2zip利用在线数据压缩算法(Lempel-Ziv-Welch),在推理时通过不断用更紧凑的超级token替换碎片化的token序列来动态扩展其活跃词汇表,这些超级token可以在生成过程中立即输出。
zip2zip的核心机制是连续词汇扩展。随着解码的进行,zip2zip不断合并共同出现的tokens作为新的超级tokens添加到超级词汇表中,并在新生成的tokens上反复应用合并操作。这种持续扩展允许模型紧凑地表示更长的、重复出现的基础token序列。
zip2zip的技术架构包含三个关键组件:基于Lempel-Ziv-Welch压缩的tokenizer,增量地将共同出现的tokens合并为可重用的超级tokens;动态嵌入(和解嵌入)层,在运行时计算新形成的超级tokens的嵌入;自回归语言建模的变体,预训练模型处理超级token化的压缩文本序列作为输入和输出。
为了计算超级token的嵌入,zip2zip引入了超级编码器,这是一个神经网络,将组成基础token的嵌入作为输入,并输出相应的超级token嵌入。这种设计的优势在于,超级token在原始模型的嵌入层(和解嵌入层)中没有固定的嵌入向量,因为它们不是原始词汇表的一部分,通过动态计算可以灵活处理各种新的词汇组合。
实验结果显示,zip2zip能够实现显著的效率提升。在Phi-3.5-4B模型上,zip2zip相比基础模型在不同上下文长度下的吞吐量提升了33.6%-102.6%,在Phi-3-14B模型上提升了41.5%-88.1%。更重要的是,zip2zip在保持模型性能的同时,通过减少token数量实现了推理时间和成本的显著降低。
Flow of Spans(FOSS)则提供了另一种动态词汇生成的思路。FOSS通过灵活地分割检索到的文本构建动态span词汇表,确保DAG结构的状态空间,这允许GFlowNets探索多样化的组合路径并提高泛化能力。通过专门的奖励模型,FOSS生成多样化、高质量的文本。
FOSS的创新在于其DAG结构的状态空间设计。标准的自回归语言模型从固定词汇表中逐个生成token,当将token采样视为动作时,会诱导出树结构的状态空间,但这限制了灵活性和表现力。FOSS通过将文本分割为可变长度的span,构建了一个DAG结构的状态空间,允许模型探索同一文本的多种有效构建方式。
三、主要机构的技术布局与最新进展
3.1 Meta:从Megabyte到BLT的技术演进
Meta在无token化技术领域的布局最为系统和深入,其技术探索可以追溯到2023年5月发布的Megabyte项目,而最新的BLT架构则代表了这一技术路线的成熟。
BLT的技术突破与开源策略。Meta发布的Byte Latent Transformer(BLT)架构是一种新的字节级LLM架构,首次在规模上匹配了基于tokenization的LLM性能,同时在推理效率和鲁棒性方面有显著改进。Meta开源了BLT,这是一种使用学习的动态方案处理字节补丁而不是tokenizer的LLM架构,使BLT模型能够匹配Llama 3模型的性能,但推理FLOPS减少50%。
BLT的技术架构采用了五级处理流程。系统使用五个阶段结合本地和全局transformers在字节级别处理数据,这允许直接处理字节流而无需首先将其转换为tokens,从而带来更大的灵活性和效率。具体而言,第一阶段,本地模型将字节转换为编码形式并组合成补丁;这些补丁然后通过大型transformer进行处理;之后另一个本地模型将它们转换回字节;在最后阶段,一个较小的transformer分析序列以预测接下来应该出现什么字节。
性能优势与应用前景。根据Meta的测试,BLT在需要理解单个字符的任务上表现优于更大的模型。仅使用80亿参数,该系统的表现就超过了Llama 3.1,尽管Llama使用了16倍的数据进行训练。新架构在扩展效率方面也被证明比当前系统更高。
Meta研究人员认为,该系统最大的优势是其处理异常或损坏文本的能力。BLT在处理罕见文本模式时表现更好,即使在输入中存在噪声或其他干扰时也能保持性能。通过使用字节补丁,BLT架构可以更精确地定位单个字符。
3.2 OpenAI:从GPT到Codex的技术储备
相比Meta的激进探索,OpenAI在无token化技术方面的布局显得更为渐进和务实,但其在相关技术领域的积累不容忽视。
GPT系列的tokenizer演进。OpenAI的GPT系列模型在tokenizer技术上持续改进。GPT-4采用了使用BPE风格方法的子词tokenizer,这是从先前模型文档和综合技术报告中推断出来的。GPT-5.1-Codex-Max在开发周期的每个阶段都具备更高速度、更强推理能力与更佳的token使用效率,成为编程时更可靠的搭档。该模型专为长时间且细节繁多的工作流程所打造,是OpenAI首款原生训练、能通过压缩处理流程(compaction)跨越多上下文视窗运作的模型,可在单一任务中协调处理数百万个tokens。
语音处理的新思路。OpenAI在语音处理方面展现了对连续处理的探索。在GPT-Realtime-2中,系统不再先把语音变成文本,而是直接在语音里完成理解和推理。采用流式处理方式,用户说话过程中即可解析意图,支持随时打断与修正,能处理自然语言中的犹豫、重复和改口。
压缩机制的创新。GPT-5.1引入了原生压缩机制,这是OpenAI在模型级别首次内置的"上下文管理"能力,能够处理数百万tokens并支持超过24小时的连续操作。这一技术虽然不是直接的无token化,但为处理超长文本和连续输入提供了新的思路。
3.3 学术界:从MIT到伊利诺伊大学的理论突破
学术界在无token化技术的理论研究方面贡献了最重要的创新突破,多个顶尖研究机构的工作为这一技术路线奠定了坚实的理论基础。
MIT的跨模态研究。MIT研究人员发现,LLM使用类似的机制,通过在中央、通用的方式抽象处理来自不同模态的数据。这一发现为无token化技术提供了重要的理论支撑——如果模型能够在通用的连续空间中处理不同模态的数据,那么抛弃离散的token表示就具备了理论可能性。
伊利诺伊大学的LangFlow突破。伊利诺伊大学厄巴纳-香槟分校的研究团队提出了LangFlow框架,首次让连续扩散真正追上甚至在某些任务上超越了离散扩散的水平。这项工作以预印本形式发布于2026年4月,论文编号为arXiv:2604.11748。
LangFlow的技术创新体现在三个方面:建立了基于流匹配和布雷格曼散度的理论基础;提出了自适应的冈贝尔噪音调度器,将生成困惑度从约1000降到154.2;重新认识了自我条件化在连续扩散中的积极作用,PPL改善幅度达19个点。
CMU的H-net架构。来自CMU、Cartesia AI等机构的研究者提出了H-net架构,这是一个端到端的分层网络,通过递归、数据依赖的动态分块(DC)过程压缩原始数据。H-net在保持与token化流程相同效率的同时,通过用从数据中学习的内容感知和上下文依赖的分割替代手工启发式方法,显著提高了建模能力。
H-net的技术特点包括:采用分层架构,工作流程分为精细处理、压缩抽象和还原输出三步;核心是动态分块(DC)机制,位于主网络与编码器/解码器网络之间,用于学习如何分割数据;通过路由模块预测相邻元素之间的边界,平滑模块使用路由器的输出插值表示。
在计算资源和数据量对等的条件下,仅采用单层字节级分层的H-net模型,其表现已优于基于BPE token的强Transformer语言模型。通过多级分层迭代建模不同抽象层级,模型性能得到进一步提升——这不仅展现出更优的数据规模效应,更能媲美两倍规模的基于token的Transformer模型。
3.4 中国公司:从百度到字节跳动的产业化探索
中国公司在无token化技术的产业化方面表现出了积极的探索态度,多家公司在相关技术领域取得了重要进展。
百度的全模态统一建模。百度文心大模型5.0采用原生全模态统一建模技术,参数量达2.4万亿,在40余项权威基准评测中,语言与多模态理解能力超越Gemini-2.5-Pro、GPT-5-High等国际顶尖模型。2026年4月,文心5.1Preview以1476分登上LMArena文本排行榜国内第一,成为榜单前15名中唯一入围的国产模型。
虽然百度没有直接发布无token化模型,但其全模态统一建模的思路与无token化技术的理念高度一致——通过统一的连续表示空间处理不同模态的数据,避免了传统tokenizer在多模态融合时的困难。
字节跳动的技术创新。字节跳动在无token化相关技术方面展现了多项创新。字节跳动、香港中文大学、上海交通大学、中科院、新加坡国立大学联合推出的BitDance巧妙绕开了传统向量量化(VQ)的词表坍缩陷阱,直接将二值化视觉Token的词表大小扩展到2^256次方。
字节跳动与慕尼黑工业大学联合提出的TiTok(Transformer-based 1-Dimensional Tokenizer),彻底打破了传统图像tokenization的桎梏:通过1D序列分词范式,仅用32个token即可实现高质量图像重建与生成,在ImageNet基准上实现410倍生成加速,同时刷新gFID指标。
月之暗面的长文本处理。月之暗面推出的AI产品Kimi智能助手,凭借20万字长文本处理能力引爆市场,颠覆了当时大模型只能处理几千字文本的行业认知,一度被视为最能对标GPT的国产大模型。从这个角度看,Kimi正在从"长文本助手"转向"面向复杂任务的Agent模型"。
DeepSeek的上下文扩展。深度求索(DeepSeek)推出的DeepSeek-V4模型,虽仍为纯文本模型(未开放多模态),但在上下文处理方面实现了史诗级突破:上下文窗口从128K直接跃升至100万Token(约150万汉字),可一次性处理《三体》三部曲全文或一个中型软件项目的全部源代码,极大提升长文档处理效率。
四、无token化技术的行业影响评估
4.1 技术层面:重构大语言模型的架构基础
无token化技术对大语言模型架构的影响是根本性和系统性的,它不仅改变了模型的输入处理方式,更重新定义了语言理解和生成的基本范式。
模型架构的根本性变革。无需tokenizer的方法代表了语言建模的重大转变,为更高效、可扩展和鲁棒的人工智能系统铺平了道路。有研究者表示:"Meta刚刚杀死了TOKENIZATION,他们发布的BLT是一种无tokenizer的架构,可以动态地将字节编码为patch,并实现更好的推理效率和稳健性!"
这种变革的核心在于端到端学习的实现。传统的tokenizer作为独立的预处理步骤,与模型的端到端学习过程分离,这不仅增加了系统复杂度,还可能成为错误或"技术债务"的来源。字节级模型则完全省去了这一环节,它们直接对原始UTF-8编码文本进行处理,大幅简化了输入流程。系统复杂度的降低不仅在设计上更简洁,还减少了潜在的故障点,使得模型在不同语言和平台上的部署与维护更加容易。
计算效率的显著提升。无token化技术在保持模型性能的同时,通过减少token数量实现了计算效率的大幅提升。以zip2zip为例,它通过在线压缩技术动态扩展词汇表,在Phi-3.5-4B模型上实现了33.6%-102.6%的吞吐量提升,在Phi-3-14B模型上实现了41.5%-88.1%的提升。
BLT架构则通过动态补丁分组机制,在匹配Llama 3性能的同时,实现了推理FLOPS减少50%的惊人效果。这种效率提升不仅体现在计算速度上,更重要的是降低了模型部署的硬件要求和运营成本。
鲁棒性和泛化能力的增强。无token化模型在处理噪声数据、罕见文本模式和多语言内容方面表现出了显著优势。BLT在处理异常或损坏文本时表现更好,在处理罕见文本模式时表现更好,即使在输入中存在噪声或其他干扰时也能保持性能。
这种鲁棒性的提升源于无token化技术对语言连续本质的尊重。传统tokenizer将连续的语言流离散化,不可避免地丢失了信息,而无token化技术通过直接处理原始输入,最大限度地保留了语言的完整性和连续性。
4.2 经济层面:成本革命与商业模式重构
无token化技术带来的经济影响是革命性的,它不仅降低了AI应用的技术成本,更可能重塑整个AI产业的商业模式。
Token成本的断崖式下降。国产AI模型处理100万Token的典型价格已降至0.3美元,而国际竞品Claude Opus的价格为5美元,价格差达到惊人的1/16。在长上下文处理等特定场景,这个差距甚至能拉大到1%以下。这种成本优势的背后,是技术架构的根本性变革——通过无token化技术减少token数量,直接降低了按token计费的成本。
实施全面token优化策略的组织可实现30-90%的成本降低,同时通常改善输出质量和延迟。以1000万月度token为例,50%的成本降低每年可节省25万美元。这种成本优势在企业规模化应用AI时尤为明显,直接影响了AI技术的商业可行性。
推理效率的指数级提升。哈尔滨工业大学团队提出的LRT隐式推理技术,能将传统思维链模式中长达2000字的显式推理过程,压缩为隐式向量计算。结果是:单任务Token消耗降低87%,延迟从15秒缩短至2秒。
商汤科技的Flash-Lite模型通过优化token使用,对比传统方式,单次任务的Token总消耗预计降低60%,直接转化为成本下降。这种效率提升不仅降低了计算成本,更重要的是改善了用户体验,使得实时交互成为可能。
商业模式的根本性重构。无token化技术推动了AI从"云端专属"走向"端侧普及"——用户只需一次性下载模型,后续使用无需联网、无需消耗云端Token,边际成本趋近于零,彻底摆脱Token焦虑。对用户而言,本地模型"一次部署、终身免费",彻底解决Token付费焦虑;对开发者而言,无需承担巨额云计算账单,可通过一次性授权、硬件绑定、生态服务等方式盈利,形成"用户与开发者双赢"的格局。
这种商业模式的转变可能彻底改变AI产业的竞争格局。传统的按token计费模式将逐渐被边缘化,取而代之的是基于模型能力、服务质量和用户体验的新竞争维度。
4.3 应用层面:多语言处理与垂直领域的突破
无token化技术在应用层面的影响主要体现在多语言处理能力的飞跃和垂直领域应用的深化两个方面。
多语言处理的公平性革命。现有LLM在处理非英语语言,特别是形态丰富语言(如芬兰语、土耳其语)或非拉丁文字系统(如中文、阿拉伯语)时效果较差,部分原因是分词不公平。BLT的字节级处理方式可以让所有语言获得更公平的表示,有望显著提升多语言能力。
Byte-level模型通过直接操作原始UTF-8数据,具备与生俱来的通用性与鲁棒性,能够处理任意语言的任意文本,且无未登录词(OOV)问题,对文本表面的细微变体也不敏感。这种能力在全球化的AI应用中具有重要意义,特别是在跨境电商、国际交流、多语言内容生成等场景中。
专业领域的适应性增强。医学、法律、编程等专业领域常有特定术语和复杂的语言结构,传统tokenizer往往无法有效处理。无token化技术通过直接处理原始文本,能够更好地适应这些领域的特殊需求。
例如,在代码生成任务中,传统tokenizer可能将代码片段错误切分,影响模型的理解和生成能力。而无token化技术可以直接处理代码的原始字节序列,保持代码结构的完整性。在生物医学领域,化学式、蛋白序列等复杂结构也能得到更好的处理。
实时交互场景的拓展。无token化技术带来的效率提升使得实时交互成为可能。例如,在语音识别和合成领域,传统的token化过程会引入延迟,影响用户体验。而直接处理音频流的连续表示可以实现真正的实时语音交互。
在多模态交互场景中,无token化技术的优势更加明显。通过统一的连续表示空间,可以无缝融合文本、图像、音频等多种模态,实现更自然、更高效的人机交互。
五、3-5年无token化技术的发展时间线
5.1 技术验证阶段(2025-2026年)
当前正处于无token化技术的关键验证期,多个技术路线都在进行大规模的实验验证和性能对比。
学术界的理论完善。根据林洲汉在WAIC 2025的判断,"目前学术界已经有成熟架构落地了,只差大厂投入资源做大模型规模化商用!" 这一判断表明,无token化技术的理论基础和原型系统已经完成,当前阶段的重点是验证这些技术在大规模应用中的可行性和优越性。
Meta的BLT架构已经在8B参数规模上完成了初步验证,证明了字节级处理在同等规模下可以匹配甚至超越传统token模型的性能。伊利诺伊大学的LangFlow框架则在连续扩散领域取得了突破性进展,首次在某些任务上超越了离散扩散的水平。
产业界的技术评估。主要科技公司正在对无token化技术进行全面的技术评估和成本效益分析。这一阶段的重点是:验证技术的成熟度和可靠性;评估与现有系统的兼容性;测算迁移成本和预期收益;制定技术路线图和投资计划。
预计在2026年底前,至少有2-3家大型科技公司会发布基于无token化技术的原型产品或技术预览版,标志着技术验证阶段的完成。
5.2 小范围应用阶段(2026-2027年)
2026-2027年将是无token化技术从实验室走向小规模商业应用的关键时期。
垂直领域的率先应用。无token化技术预计将在以下垂直领域率先实现商业化应用:
多语言内容生成领域:由于无token化技术在多语言处理方面的天然优势,跨境电商、国际媒体、翻译服务等行业将成为最早的应用场景。这些领域对语言多样性和准确性要求较高,传统tokenizer的局限性已经成为业务发展的瓶颈。
专业内容处理领域:法律文档、医学文献、代码生成等专业领域对文本处理的精确性要求极高,无token化技术能够更好地保持专业术语和复杂结构的完整性。
实时交互场景:语音识别、实时翻译、智能客服等需要低延迟的场景将受益于无token化技术带来的效率提升。
技术标准的制定。这一阶段将开始制定无token化技术的行业标准和规范,包括:数据格式标准、模型接口规范、性能评估指标、安全隐私要求等。这些标准的制定将为后续的大规模应用奠定基础。
5.3 规模化商用阶段(2027-2028年)
2027-2028年将是无token化技术实现规模化商业应用的爆发期。
主流厂商的全面布局。预计在这一阶段,主要的AI厂商都会推出基于无token化技术的产品系列。这些产品将覆盖从基础模型到应用工具的完整产品线,形成与传统token模型并行的技术生态。
根据技术发展趋势,预计到2028年底,市场上将会出现:
• 5-10个主流的无token化大模型
• 20个以上的垂直领域专用模型
• 100个以上的应用工具和开发框架
• 500个以上的商业应用案例
成本优势的充分显现。随着技术的成熟和规模化应用,无token化技术的成本优势将充分显现。预计到2028年,采用无token化技术的AI应用将实现:
• Token消耗降低60-80%
• 推理延迟降低50-70%
• 硬件成本降低30-50%
• 运营成本降低40-60%
5.4 全面普及阶段(2028-2030年)
2028-2030年将是无token化技术从补充方案转变为主流选择的时期。
技术生态的成熟完善。到2030年,无token化技术将形成完整的技术生态系统,包括:
开发工具链:成熟的IDE插件、调试工具、性能分析器等。
模型动物园:涵盖各种规模和应用场景的预训练模型。
服务平台:云服务、边缘计算、本地部署等多种部署方式。
人才培养体系:大学课程、职业培训、认证体系等。
市场格局的根本性变化。预计到2030年,无token化技术将在以下方面占据主导地位:
• 新发布的大模型中,70%以上将采用无token化技术
• 在多语言处理领域,无token化技术的市场份额将超过80%
• 在实时交互场景中,无token化技术将成为标准配置
• AI应用的总体成本将降低50%以上
六、研究成果的应用价值与实践指南
6.1 学术研究:构建无token化技术的理论体系
基于对无token化技术的深入研究,我们可以为学术研究提供系统性的理论框架和方法论指导。
研究问题的精准定位。在无token化技术的研究中,以下问题值得深入探讨:
连续表示与离散表示的理论界限在哪里?无token化技术是否能够完全替代token化技术,还是两者将长期并存?
多模态融合场景下,无token化技术如何处理不同模态之间的语义对齐问题?
在资源受限环境下,无token化技术的性能表现如何?如何在保持性能的同时降低计算成本?
隐私保护场景中,无token化技术是否能够提供更好的安全保障?
方法论框架的构建。建议采用以下研究方法:
比较研究法:将无token化模型与传统token模型在相同任务上进行对比,量化分析其优势和劣势。
案例研究法:深入分析典型的无token化技术(如BLT、LangFlow、zip2zip),总结其设计理念和实现路径。
实验验证法:设计系统性的实验,验证无token化技术在不同场景下的性能表现。
理论建模法:建立无token化技术的数学模型,从理论层面分析其可行性和局限性。
论文写作的结构建议。基于本研究的分析框架,建议采用以下论文结构:
引言部分:阐述tokenizer的历史局限性和无token化技术的研究背景,明确研究问题和贡献。
技术综述:系统梳理无token化技术的三大路线,分析各路线的技术特点和发展现状。
方法论:详细描述研究方法、实验设计和评估指标。
实验结果:展示无token化技术在不同任务上的性能表现,与传统方法进行对比。
讨论与分析:深入分析实验结果,探讨无token化技术的优势、挑战和发展前景。
结论与展望:总结研究贡献,提出未来研究方向。
6.2 行业分析:洞察技术变革的商业机遇
无token化技术的兴起为行业分析提供了全新的视角和机遇,准确把握这一技术趋势将有助于企业制定前瞻性的战略规划。
市场机会的识别框架。基于对无token化技术发展趋势的分析,建议关注以下市场机会:
技术服务提供商:为企业提供无token化技术的迁移服务、培训服务和咨询服务。
垂直应用开发商:在多语言处理、专业内容生成、实时交互等领域开发基于无token化技术的应用。
硬件设备制造商:开发专门针对无token化模型优化的芯片和硬件设备。
数据服务提供商:提供适合无token化模型训练的高质量数据集。
竞争格局的分析方法。建议采用以下框架分析无token化技术领域的竞争格局:
技术能力评估:分析主要玩家在无token化技术方面的研发实力、专利布局和技术储备。
产品策略分析:研究各厂商的产品路线图、定价策略和市场定位。
生态系统评估:分析各厂商的合作伙伴关系、开发者社区和技术标准制定能力。
财务表现分析:评估无token化技术对企业营收、成本和盈利能力的影响。
投资机会的评估标准。在评估无token化技术相关的投资机会时,建议采用以下标准:
技术成熟度:评估技术的可行性、稳定性和可扩展性。
市场需求:分析目标市场的规模、增长潜力和竞争程度。
商业模式:评估盈利模式的可持续性和竞争优势。
团队能力:评估创始团队的技术背景、行业经验和执行力。
风险因素的识别与管理。投资无token化技术需要关注以下风险:
技术风险:无token化技术仍处于发展阶段,存在技术路线选择错误的风险。
市场风险:市场接受度和商业化进程可能低于预期。
竞争风险:大型科技公司的进入可能改变竞争格局。
监管风险:相关技术标准和政策法规可能影响技术发展。
6.3 产品开发:制定技术路线图与实施方案
对于产品开发团队而言,无token化技术提供了重新定义产品架构和用户体验的机会。
技术路线图的制定方法。基于3-5年的发展时间线,建议采用以下技术路线图:
短期目标(1年内):
• 完成技术调研和评估,确定适合的无token化技术路线
• 选择1-2个试点项目,验证技术可行性
• 建立技术团队,进行相关技术培训
中期目标(2-3年):
• 推出基于无token化技术的原型产品
• 在核心业务场景中验证技术效果
• 建立完整的开发和运维体系
长期目标(3-5年):
• 实现产品的全面无token化升级
• 建立技术标准和行业影响力
• 探索新的商业模式和应用场景
实施方案的关键步骤。建议采用以下实施步骤:
需求分析阶段:明确产品对无token化技术的具体需求,包括性能要求、成本预算和时间计划。
技术选型阶段:根据需求分析结果,选择合适的无token化技术路线(直接字节处理、连续隐状态建模或动态词汇生成)。
原型开发阶段:开发技术原型,验证技术方案的可行性和性能表现。
测试验证阶段:进行全面的功能测试、性能测试和安全测试。
产品化阶段:将原型转化为可商用的产品,建立完善的文档和支持体系。
开发团队的能力建设。无token化技术的开发需要具备以下能力:
算法研发能力:掌握深度学习、自然语言处理等核心算法。
工程实现能力:具备大规模系统的设计和开发经验。
性能优化能力:能够针对无token化模型进行计算优化和内存优化。
跨学科知识:了解语言学、信息论、计算机体系结构等相关知识。
风险控制与应对策略。在产品开发过程中,需要注意以下风险控制措施:
技术风险控制:建立技术预研机制,及时跟踪技术发展趋势。
进度风险控制:制定详细的项目计划,设置关键里程碑和风险点。
质量风险控制:建立完善的测试体系,确保产品质量。
市场风险控制:密切关注市场反馈,及时调整产品策略。
结语
通过对Tokenizer技术演进历程的深入分析,以及对无token化技术三大路线的系统梳理,我们可以得出一个明确的判断:Tokenizer作为经典AI时代的过渡产物,其历史使命即将终结,无token化技术将在未来3-5年内成为主流。
这一技术变革的根本驱动力在于连续语言本质与离散处理方式之间的固有矛盾。正如研究者所言,"语言本身是连续的、复杂的、充满歧义的。但对计算机而言,它只能处理离散符号和向量运算"。无token化技术通过直接处理原始字节序列、在连续隐空间中进行推理、动态生成词汇等创新方式,为解决这一根本性矛盾提供了可行的技术路径。
从技术发展的角度看,无token化技术已经跨越了理论验证阶段,Meta的BLT、伊利诺伊大学的LangFlow、CMU的H-net等创新成果证明了这一技术路线的可行性和优越性。特别是BLT架构在8B参数规模上实现了与传统token模型相当的性能,同时推理FLOPS减少50%,这一突破性进展标志着无token化技术已经具备了大规模商用的技术基础。
从商业价值的角度看,无token化技术带来的成本革命是颠覆性的。Token消耗降低60-87%、推理延迟缩短至原来的1/7、单任务成本降低50%以上,这些数字背后是AI技术普及化的巨大机遇。更重要的是,无token化技术推动了AI从"云端专属"走向"端侧普及",为构建"用户与开发者双赢"的新商业模式提供了可能。
从应用前景的角度看,无token化技术在多语言处理、专业内容生成、实时交互等领域展现出了传统token模型无法比拟的优势。特别是在全球化和多模态交互日益重要的今天,无token化技术的通用性和鲁棒性将成为决定AI应用成败的关键因素。
展望未来,我们建议各方参与者采取以下行动:
对于学术界,应继续深化无token化技术的理论研究,特别是在连续表示学习、多模态融合、高效推理等方向进行创新突破。同时,需要建立完善的评估体系和理论框架,为技术发展提供科学指导。
对于产业界,应积极布局无token化技术,通过技术预研、人才储备、产品规划等方式抢占先机。建议采用渐进式的技术迁移策略,在保持现有业务稳定的同时,逐步引入无token化技术。
对于投资者,无token化技术代表了AI产业的下一个重大机遇,建议关注技术领先的初创公司和具备技术转型能力的传统企业。同时需要注意技术风险和市场风险的控制。
对于政策制定者,应关注无token化技术对就业、隐私、安全等方面的影响,制定相应的政策法规,引导技术健康发展。
最后,我们必须认识到,无token化技术的发展不是要完全取代传统token模型,而是为AI技术提供了更多的选择和可能。在未来相当长的一段时间内,两种技术路线将并存发展,各自在不同的应用场景中发挥优势。真正的赢家将是那些能够根据具体需求灵活选择技术方案,并不断创新的企业和开发者。
无token化技术的兴起,标志着AI技术正站在一个新的历史起点上。这不仅是一次技术架构的革新,更是对人类语言理解和机器智能本质的重新思考。随着这一技术的成熟和普及,我们有理由相信,AI将变得更加智能、高效、普惠,为人类社会带来更大的福祉。
无token化技术的意义,或许不止于模型效率与成本的优化。当AI能够以连续、原生的方式理解人类语言乃至多模态世界时,人机之间将不再依赖“离散符号协商”,而是共享同一语义场。这种变化,正是“碳硅共生”这一未来文明形态得以成立的前提条件之一。

 

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐