摘要:工商銀行與華為開展聯合創新,成功落地分布式KV Cache多級緩存推理加速方案。該方案基于昇騰+vLLM-Ascend+openYuanrong,構建覆蓋HBM、DRAM的異構統一內存資源池,并對H2D/D2H數據等傳輸路徑進行昇騰硬件親和優化,實現推理過程中的高效數據調度與緩存管理。基于GLM-5模型實測,在持續多輪對話、Agentic AI長程任務等超長序列推理場景中,分布式多級緩存方案可以實現Prefill性能提升70%+,有效提升用戶體驗,支撐工商銀行規模化業務落地。

隨著DeepResearch、智能代碼生成等Agentic應用在金融場景中不斷落地,大模型正從簡單問答走向復雜任務執行。在這一過程中,模型需要處理多輪對話上下文以及多步推理過程,長序列推理能力逐漸成為主流大模型的關鍵能力。在Reasoning與Agentic應用的推動下,推理系統不僅需要支持百萬級的Token處理,還需在實時交互場景中保持極低時延。如何在長上下文理解與低時延推理之間實現高效協同,正成為大模型推理系統的重要演進方向。
作為金融科技創新的引領者,工行構建并持續提升企業級大模型技術體系工銀智涌,將大模型技術廣泛應用于手機銀行、智能客服、理財咨詢、風險控制等500+個核心場景。當前GLM、DeepSeek等MoE大模型在業務場景中已得到廣泛應用,表現優異,但隨著應用持續深入,長序列任務帶來的高成本和時延波動問題逐漸凸顯。特別是在多輪對話等復雜場景下,由于KV緩存占用顯存過高,現有的推理架構在負載均衡、長序列性能損耗以及Agent記憶連續性方面,仍存在一定的優化空間。
為提升推理效能,工商銀行聯合華為,基于昇騰算力底座和華為云Stack成功試點多級緩存推理加速方案。該方案基于openYuanrong異構存儲資源池,統籌管理HBM、DRAM空間,應對長序列推理中的KV緩存壓力;同時利用vLLM-Ascend PrefixCache高效調度技術實現異步和分塊緩存高效加載。在GLM系列模型的推理性能實測中,針對200K/100K典型超長序列長度,系統平均TTFT降低70%,吞吐效率提升40%,充分驗證了異構內存管理在解決負載失衡、TTFT時延高等問題上的有效性。
該加速方案依托昇騰硬件,通過平臺層、網絡層與硬件層的深度協同,實現昇騰平臺的深度適配與優化:
1. 異構數據對象抽象:突破顯存讀寫瓶頸,吞吐性能達14+GB/s
openYuanrong異構數據對象支持HBM,并實現H2D/D2H高性能傳輸,RH2D零拷貝直通傳輸,單卡批量數據RH2D傳輸吞吐可達14+GB/s;
2. 高性能分布式異構多級緩存:打破顯存墻,釋放異構內存聚合效能
統一抽象集群內的HBM、DRAM資源,構建異構內存池。通過多級緩存架構,支持數據在不同存儲層級間的極速流轉(H2D/D2H),緩解顯存容量限制。
3. PrefixCache高效調度:模型解耦,分塊高效命中
利用vLLM-Ascend PrefixCache高效調度技術,針對業務前綴重復高的輸入,實現異步和分塊緩存高效加載,公共Attention組圖組件,新模型無需特別適配,有效減少了冗余計算開銷。
依托上述能力,工商銀行在多輪對話、Agentic AI長程任務規劃場景中實現Prefill性能提升70%+,有效支撐大規模用戶交互和復雜任務處理。該技術已完成技術驗證并在工行智能體業務場景中試點,后續將在大EP等典型推理場景中進一步推廣。未來,工商銀行將繼續聯合華為深化技術探索、優化推理底座性能,并結合業務需求,將該能力逐步推廣至更多金融場景,實現大模型技術在金融業務的廣泛落地與規模化應用。


















