前三步决定它「能不能干」,这一步决定它「值不值得天天用」。
调优 = 在「成本 × 可靠性」上,为这个场景挑最优点
01 · 成本同样的效果,token 可能差几倍
达到同一个结果,不同模式的推理成本天差地别——思维树(Tree of Thoughts)搜索多条思路,强但贵;ReWOO 一次性规划、去掉中间观测,省 token。 我们按场景选:高频、低风险的活,就换上省 token 的模式,把单次成本压下来;这笔账,在交付前就替你算清。
02 · 可靠性该自检的自检,该兜底的兜底
高风险场景,宁可慢一点、贵一点,也要加自我复核(Reflexion / Self-Refine)、加护栏、加人审,把出错的代价摁住;低风险、容错高的场景,就从简,别为用不上的稳健性买单。 可靠性不是越多越好,而是配得正好。
03 · 为「这一个场景」优化不是通用最优,是你的最优
没有放之四海皆准的最优配置。我们调的,是你这个场景在成本、速度、可靠性之间的那个平衡点——这也是为什么交付前要拿真实数据反复测:分数高不算数,又快又稳又付得起才算数。