马克斯·普朗克智能系统研究所发布了一项关于“多流大语言模型”的最新研究论文,旨在解决当前基于LLM的智能体在架构层面存在的核心计算瓶颈。论文指出,尽管从ChatGPT早期指令微调模型至今,大模型的能力飞速发展,并广泛应用于编程和计算机控制等自主智能体场景,但系统的底层架构并未发生根本性变化。现有的先进AI智能体仍然依赖于单一计算流的消息交换格式,即顺序地与用户、系统、自身(思维链)及工具进行交互。这种单线程的顺序处理模式导致了严重的性能局限:智能体在读取信息时无法生成输出,在写入输出时无法对新信息做出反应;同样,模型也无法在执行动作的同时进行思考,或在读取信息的同时进行处理。为了打破这一限制,该研究提出了一种名为“多流LLMs”的新范式。通过从针对顺序消息格式的指令微调转向针对多个并行计算流的指令微调,将每个角色(如感知、思考、行动)分离到独立的流中。在该架构下,大模型的每一次前向传播都会同时从多个输入流读取数据,并在多个输出流中并行生成令牌,且所有流均依赖于之前的时间步长。这种数据驱动的架构变更不仅解决了上述易用性限制,通过并行化显著提升了模型效率,还通过更好的职责分离增强了模型的安全性,并提高了对模型行为的可监控性。
事件分析
💡 核心观点:将大模型从“单线程打字机”进化为“多线程处理器”,是AI智能体迈向实时并发处理的关键范式跃迁。
原文链接:Hacker News





