返回 ppt-master
03_problem.md
1 先说清楚痛点:模型越大,全量微调就越不可行。全量 fine-tuning 会更新模型的全部参数,得到的新模型和原模型一样大。以 GPT-3 一千七百五十亿参数为例,每适配一个下游任务,就要存一份完整的满参数副本。如果你有很多任务,存储和切换的成本就是任务数乘以一千七百五十亿,这已经从早年的"不太方便"升级成了真正的部署难题。
1 lines MARKDOWN