Robust KV Cache Management for LLM Serving under Output Token Length Uncertainty
arXiv cs.NI针对LLM推理服务中GPU集群KV缓存需在请求到达时预留、但输出长度生成前未知的矛盾,论文提出鲁棒的KV缓存管理方法。旨在缓解显存瓶颈、提升大规模LLM服务吞吐。
AI × Networking Daily.
2026-07-22 版 · taolab.dev · 归档
AI × 网络
针对LLM推理服务中GPU集群KV缓存需在请求到达时预留、但输出长度生成前未知的矛盾,论文提出鲁棒的KV缓存管理方法。旨在缓解显存瓶颈、提升大规模LLM服务吞吐。
论文提出PERA框架,为6G网络构建感知-推理-行动一体化接口,衔接传感、认知推理与可信智能体响应。推动下一代网络从预编程协议向自主可信智能演进。
论文提出Token Communications(TokCom)统一框架,主张AI从静态感知走向生成式推理与自主智能体后,经典香农通信范式需向AI原生通信范式转变。探讨token级语义通信取代比特可靠传输的路径。
论文提出HuGLEN评估流程,用LLM-as-judge结合人工校验,衡量不同LLM家族在光网络自动化任务中的输出质量与推理成本差异。为运营商选型AI自动化工具提供实证依据。
论文系统梳理AI原生6G网络中智能体间通信的现状、协议碎片化挑战与机遇,认为智能体通信将成为未来互联网基础设施的核心需求之一。
网络
Packet Pushers播客讨论部分企业因AI工作负载的安全与成本考量,从'单一云优先'转向自建数据中心的云回迁趋势。分析了回迁决策背后的战略权衡。
Oracle因威斯康星州近1GW数据中心项目(与Vantage、OpenAI合建)被监管方要求维持每年70亿美元电力保障承诺,年成本高达1亿美元。凸显AI算力扩张对电网基础设施的巨大压力。
Packet Protector播客剖析双栈环境下的IPv6安全风险,包括VPN流量绕行和攻击者利用未受监控的IPv6通道。多数企业未针对v6做好监控与防护,存在安全盲区。
英伟达展示下一代Vera Rubin平台,面向以token产出为核心指标的"AI工厂"算力优化。标志着数据中心网络与计算架构进一步围绕LLM推理吞吐重构。
初创公司Accelsius展示两相冷却技术,将戴尔PowerEdge液冷服务器改造为制冷剂散热,GPU温度可降低达14°C。应对AI加速器发热导致的数据中心散热危机。
谷歌云一次数据中心级故障(三项服务受影响,源于"上游"电力问题)显示,即便超大规模云厂商的真实容灾能力仍难以被外界准确评估。该可用区其余部分未受波及。
Cloudflare Internal DNS正式GA,将权威与递归DNS能力扩展到内网场景,复用其支撑Zero Trust和公共DNS的全球网络与控制面。企业可借此统一内外部DNS管理。
AI
OpenAI与Hugging Face联合应对一起模型评估安全事件,具体细节尚未完全披露。事件凸显第三方模型托管平台在AI供应链中的安全风险。
谷歌发布Gemini 3.6 Flash、3.5 Flash-Lite及面向安全场景的3.5 Flash Cyber模型,强化轻量化与专用能力。新模型已接入Google Cloud Agent平台。