Dynamic Model Routing and Cascading for Efficient LLM Inference: A Survey
arXiv cs.NI该综述系统梳理了大语言模型推理时的动态路由与级联技术,即根据任务复杂度在多个不同能力和成本的模型间智能调度请求。这类方法让简单查询走小模型、复杂任务走大模型,在保持效果的同时显著降低推理成本,是AI基础设施优化的重要方向。
AI × Networking Daily.
2026-09-02 版 · taolab.dev · 归档
AI × 网络
该综述系统梳理了大语言模型推理时的动态路由与级联技术,即根据任务复杂度在多个不同能力和成本的模型间智能调度请求。这类方法让简单查询走小模型、复杂任务走大模型,在保持效果的同时显著降低推理成本,是AI基础设施优化的重要方向。
该综述聚焦大语言模型在网络运维(NetOps)和IT运维(AIOps)中的智能体化应用,涵盖遥测检索、故障诊断、配置规划等任务架构。文章重点讨论评估方法与安全边界,即如何限定LLM智能体的自主操作范围以避免误操作风险。
AgenticNet提出用AI编码智能体自动生成混合网络实验(结合仿真与模拟环境),替代传统人工搭建实验的方式。该工具展示了AI智能体在网络研究工具链中承担实验设计与执行角色的可行性。
该论文重新审视Bruck算法,为可重构网络中的All-to-All集合通信设计更省阶段的方案,直接针对分布式机器学习和高性能计算中的互连带宽瓶颈。这类集合通信优化对大规模AI训练集群的扩展效率至关重要。
RadioSight利用动态神经辐射场对毫米波信道进行建模和预测,提前预判用户移动和遮挡导致的波束中断,从而优化XR设备的波束管理。这是将神经场AI技术引入无线网络实时优化的代表性尝试。
英伟达正将NVLink互连技术打包授权给其他芯片厂商,即便客户采购非英伟达GPU,系统内部互连仍可能依赖英伟达专利技术。这一策略让英伟达在AI数据中心网络互连层面构建起近乎垄断的知识产权护城河。
网络
微软和AWS推出跨云私有100Gbps直连服务,让两大平台间无需数月网络工程即可打通,此前双方曾淡化多云互联需求。此举反映出企业客户对高带宽、低延迟跨云网络(尤其为AI工作负载)的现实需求正倒逼云厂商合作。
Cloudflare在其Pingora代理中试验对缓存内容做Zstandard转码压缩,在不增加硬件规模的前提下大幅提升缓存空间利用率,预计可节省数PB存储。该方案展示了大规模CDN基础设施中压缩算法优化带来的显著成本收益。
建站软件商Softaculous遭遇长达33小时的BGP劫持,流量被恶意重定向,公司已要求用户重置凭证并排查是否被植入恶意软件包。事件再次凸显BGP路由缺乏原生认证机制,互联网关键基础设施仍暴露在劫持风险之下。
文章以近期Telstra大规模故障为引子,剖析精确时间同步这一常被忽视却对现代网络至关重要的底层依赖。时钟同步一旦出现偏差,会连锁引发路由、认证乃至分布式系统层面的严重故障。
AI
Anthropic发布Claude Fable 5.1与Claude Mythos 5.1两款新模型,并同步公开系统卡等技术细节。此次更新延续了Claude系列在能力和安全评估上的迭代节奏。
最新调查显示生成式AI已渗透80%的职业岗位,但在多数岗位中实际使用者不足半数,呈现"广而不深"的采用特征。这一数据为企业AI投入与实际生产力转化之间的落差提供了量化佐证。
甲骨文在裁员2.1万名员工后,将业绩希望寄托于AI辅助工程带来的"超人类"级程序员生产力提升。公司高调宣传AI编码工具效果,但外界对其裁员与AI叙事之间的因果关系存疑。
VMware借用英伟达力推的"AI工厂"概念术语,转而与竞争对手AMD合作构建类似方案,凸显厂商在AI基础设施营销话语权上的博弈。文章建议客户跳过品牌包装,直接关注实际的token使用成本。