OmniTools 7月16日消息,IBM研究院近日在Hugging Face博客发布技术文章指出,模型路由远非简单的任务分类问题,而是一个涉及成本、复杂度与延迟的多维系统优化难题。
研究基于AppWorld Test Challenge中417项任务的实测数据发现:GPT-4.1在纸面定价更低,但实际运行成本(155美元)却接近Claude Sonnet 4.6(79美元),主因是缓存命中率差异显著影响了有效输入成本。
文章指出,任务难度难以在路由前准确预判,且企业场景还需同步满足合规、数据驻留、隐私等约束;延迟也不仅取决于模型本身速度,更受基础设施状态、缓存温度及路由粒度(如每步路由 vs 每任务路由)影响。为此,IBM将路由重构为轻量级多目标优化问题,在约6毫秒决策开销下,实现了成本、精度与延迟的可调权衡——例如某配置在84%准确率下较纯Opus方案降低21%成本与9%延迟。
该研究强调,高效路由的关键不在于“选对模型”,而在于“找到整个系统的最优运行点”,模型仅是其中一环,需与缓存行为、服务架构及工作负载模式协同建模。