大语言模型(Large Language Model,简称 LLM)是一种用海量文本训练出来的人工智能程序。你给它一段话,它能接着生成出语法通顺、意思连贯的下文——本质上是在回答一个问题:"根据见过的所有文字,这里最可能出现的下一个词是什么?"
听起来简单,但当模型在数万亿字的书籍、网页、对话中反复练习这件事后,它内部会"压缩"出语言规律、事实知识和推理方式。于是它不仅能接话,还能回答问题、写代码、做翻译、分析材料。
所谓"大",主要指参数量和训练数据量。参数可以粗略理解为模型内部的可调旋钮,从几十亿(数十亿参数)到上千亿不等。参数越多、数据越丰富,模型处理复杂任务的能力通常越强,但运行成本也越高。
它们都是大语言模型,只是由不同公司用不同数据和方法训练:GPT 来自 OpenAI,文心一言来自百度,DeepSeek 来自深度求索,Claude 来自 Anthropic。大家都建立在类似的技术思想(Transformer 架构)之上,差异主要在训练数据、规模和调校方式。
擅长:语言理解与表达、总结归纳、写代码初稿、头脑风暴。
不擅长:精确计算、保证事实永远正确、掌握训练截止之后的新信息。因此重要结论需要核实,让模型"联网检索"或"引用来源"是降低出错率的常见做法。