摘要:在模型互联网中, 单个基模型受限于自身推理能力, 其推理精度往往存在瓶颈. 虽然基模型可以通过与协作模型的Token级并联协作提升精度, 但现有方法多采用全程Token级并联协作策略, 导致较高的Token开销和推理时延. 针对上述挑战, 提出一种基于置信度的协作推理方法CobCo. 该方法以基模型置信度为核心调控信号, 动态调节其推理行为. 当基模型置信度较低时, 引入协作推理以降低推理错误风险, 而在置信度较高时采用独立推理以减少冗余协作开销. 为支撑上述推理调节机制, 设计一种面向Token级并联协作的置信度评估算法, 通过将协作结果作为外部参照刻画基模型在逐步推理过程中的决策优劣, 并基于Beta分布对其置信度进行动态量化. 实验结果表明, 在引入CobCo后, 基模型的推理准确率相较于其独立推理提升了2.4%–27.6%. 与现有全程Token级并联协作方法相比, CobCo在推理准确率损失较小的前提下显著降低了Token开销与推理时延. 特别地, 当基模型与协作模型性能相近时, CobCo能在保持推理准确率不下降的情况下, 将Token开销最高降低约20.8%.