跟AI聊AI,学习AI相关知识
如何理解大模型的agentic?
“Agentic”这个词来找的更准确对应可能是”具有能动性/能自主行动的”,用来形容大模型从一个”一问一答的对话工具”转变为一个”能自己规划、自己行动、自己纠错的系统”。理解这个概念,可以从几个层面来看。
最核心的区别在于反馈循环的存在与否。普通的对话模式是单轮的:你问,模型答,结束。Agentic的模型则是在一个循环里运行——它会先思考需要做什么,调用某个工具或执行某个动作,观察这个动作返回的结果,再根据结果决定下一步该做什么,如此往复,直到任务完成或者判断需要向人求助为止。这个”感知-决策-行动-再感知”的循环是agentic行为的骨架。
其次是自主性和多步骤规划。一个agentic系统面对”帮我把这个仓库里的bug修好”这样的任务,不会指望用户把每一步都拆解好喂给它,而是自己把大目标拆解成一串子任务:先去读代码理解结构,再定位问题,写修复方案,跑测试验证,如果测试失败就返回去调整。这种把模糊目标转化为具体步骤序列的能力,是agentic和普通问答最大的分野。
第三是工具使用能力。Agentic的模型通常被赋予了实际”动手”的手段——读写文件、执行代码、调用API、操作浏览器等等。模型本身不再只是输出文本,而是文本输出会被解释成具体的动作指令,执行后的真实世界结果(比如代码跑起来报错了,或者网页加载出了新内容)又会反馈回模型,成为它下一步推理的依据。这也是为什么”agentic”经常和”tool use”、”function calling”连在一起讨论。
第四是应对不确定性和失败的能力。真实任务很少一次成功,agentic系统需要能识别”这一步没达到预期”、决定是重试、换一种方法,还是放弃并求助用户,而不是机械地执行一条预设好的流水线。这种自我纠错、动态调整的能力,是agentic区别于简单脚本自动化的关键。
举个具体的例子可能更直观:你让我”研究一下某家公司最近的财报,做成一份PPT”。非agentic的做法是我凭已有知识直接编一份内容。Agentic的做法是我会先意识到财报信息可能过时或不在我的训练数据里,于是主动去搜索、抓取权威来源,读取实际数字,交叉验证几个来源是否一致,再决定PPT该怎么组织,调用工具生成文件——这整个过程中间可能要来回好几轮,期间不断根据拿到的信息调整下一步动作。这就是agentic在实际工作流里的样子。
值得留意的是,agentic能力不是有或没有的二元状态,而是一个程度问题——从简单的单次工具调用,到能自主规划几十步、跨多个工具协同、长时间运行的复杂任务,中间有很大的能力跨度。目前业界评估一个模型”agentic能力强不强”,很大程度上就是看它在长链条任务里能不能保持目标不漂移、能不能有效利用工具、能不能在出错时自己发现并纠正。
RLHF是什么?
RLHF全称是Reinforcement Learning from Human Feedback,也就是”基于人类反馈的强化学习”,是训练大语言模型对齐人类偏好的一种核心方法。
要理解RLHF,可以先回想大模型训练通常分几个阶段。第一步是预训练,模型在海量文本上学习预测下一个词,这一步让模型获得了广泛的知识和语言能力,但它并不天然知道什么样的回答是”好”的、什么是人类真正想要的——它只是在模仿训练数据的统计规律。第二步通常是监督微调(SFT),用人工写好的高质量问答样本让模型学着模仿这种问答风格。RLHF则是在这之后的第三步,目的是进一步让模型的行为更贴近人类的偏好和价值观,比如更有帮助、更诚实、更安全。
RLHF的具体流程一般分三步。首先,让训练好的模型针对同一个提示生成多个不同的回答,然后请人类标注者对这些回答进行比较排序,比如”回答A比回答B更好”。这一步的产出是大量的人类偏好对比数据。接着,用这些偏好数据训练一个独立的”奖励模型”(reward model),让它学会给任意一个回答打分,分数高低反映这个回答有多符合人类偏好——本质上是把人类零散的偏好判断,压缩成一个可以自动打分的函数。最后一步,用强化学习算法(最常见的是PPO,近端策略优化)去微调原来的语言模型,让它在生成回答时尽量获得奖励模型给出的高分,同时通常会加一个约束项(比如KL散度惩罚),防止模型为了骗取高分而偏离原本语言能力太远、生成一些奇怪但能”钻空子”拿高分的内容。
这么做的意义在于,很多”好回答”的标准很难用规则写死,比如什么叫委婉、什么叫过度啰嗦、什么时候该拒绝一个请求,但人类看到两个回答时往往能凭直觉判断哪个更好。RLHF相当于把这种难以形式化、但人类容易判断的偏好,转化成模型可以在训练中直接优化的信号,从而让模型的输出更符合人的期待,而不只是统计上”像”训练语料。
需要说明的是,RLHF不是唯一的对齐方法,近年也出现了一些替代或补充方案,比如DPO(直接偏好优化)省去了单独训练奖励模型和强化学习的步骤,直接用偏好数据优化策略模型,计算上更简单;也有工作探索用AI自己生成反馈来代替部分人类标注(比如Constitutional AI的思路)。但RLHF作为把人类偏好引入模型训练闭环的开创性方法,至今仍是理解现代对话式大模型为何”听起来像在好好说话”的关键概念。
如何理解AGI?
AGI全称是Artificial General Intelligence,通常译作”通用人工智能”,指的是一种能够像人类一样,在几乎任何智力任务上都表现出灵活、通用能力的人工智能系统,而不是只擅长某个狭窄领域。理解这个概念,有几个层面值得区分开来看。
首先要对比的是”狭窄人工智能”(Narrow AI)。我们今天看到的绝大多数AI系统,包括下棋程序、图像识别模型,乃至今天的大语言模型,严格来说都属于狭窄AI——它们在特定任务或任务集合上表现出色,但这种能力不会自动迁移到训练时完全没见过的新领域。AGI则被设想为具备跨领域的通用学习和推理能力:一个真正的AGI系统理论上应该能像人一样,把在一个领域学到的知识和方法,灵活迁移应用到全新的、事先没有针对性训练过的问题上,并且能够持续自主学习,而不需要人类每次针对新任务重新设计和训练。
其次,”AGI到底应该如何定义、达到什么标准才算AGI”本身在学界和业界并没有统一共识,这也是理解这个词时最容易混淆的地方。有的定义强调”达到或超过普通成年人在几乎所有认知任务上的表现”;有的更强调自主性和长期规划能力,比如能不依赖人类干预地设定和追求长期目标;也有一些机构(比如某些AI公司)给出过更偏经济学的定义,比如”能完成大多数具有经济价值的工作”。因为定义本身模糊且带有价值判断,不同研究者、不同公司谈论AGI时,实际上可能在说不同的事情,这也是为什么关于”AGI还有多远””某个模型算不算AGI”的讨论经常各说各话。
第三,值得注意当前大语言模型和AGI概念之间的关系存在争议。一部分观点认为,像GPT系列、Claude这样的大模型已经展现出相当程度的通用性——同一个模型能写代码、写诗、做数学题、进行多轮对话规划,这种跨任务的灵活性被视为通往AGI路上的重要进展。另一部分观点则认为,当前大模型本质上仍是基于统计模式匹配的”高级插值机”,缺乏真正的因果推理、持续学习、具身经验和自主目标设定能力,与人类智能的通用性有本质差异,不能简单地把”参数更大、任务更多”等同于通用智能的出现。这两种立场目前都有严肃的研究者持有,分歧很大程度上源于对”智能””理解””通用性”这些概念本身如何界定。
第四是围绕AGI的社会和安全讨论,这也是这个词经常伴随出现的语境。如果一个系统真的具备了通用、自主、可能超越人类水平的能力,随之而来的问题包括:如何确保其目标与人类利益保持一致(对齐问题)、如何评估和监测这种能力的出现(因为很可能不是一个清晰的临界点,而是渐进过程)、以及社会、经济、治理层面该如何应对。这也是为什么Anthropic、OpenAI等机构都把”AGI何时/是否会出现”和”如何安全地应对这种可能性”作为核心议题在讨论,即便他们对具体时间线和实现路径的判断并不完全一致。
总的来说,理解AGI比较稳妥的方式是把它看作一个尚在演变、边界模糊的概念性目标,而不是一个已经有明确技术定义和验收标准的既定事实。目前的进展、时间线预测,以及”这条路是否走得通”本身,仍然是业界正在激烈辩论、没有定论的问题。
长思考的推理模型是如何实现的?
“长思考”推理模型指的是像OpenAI的o1/o3系列、DeepSeek-R1、以及Claude的扩展思考模式这类,在给出最终答案前会先生成一段较长的中间推理过程(通常称为”思维链”或”thinking”)的模型。理解它们是如何实现的,可以从训练方法和推理机制两个层面来看。
先说一个背景转变。早期让模型”想得更清楚”主要靠提示工程,比如著名的Chain-of-Thought提示,在提示词里加一句”let’s think step by step”,诱导模型在回答前先写推理步骤——这本质上是利用模型已有能力,通过提示把它引导出来,模型本身没有针对性训练过如何推理。而现在的长思考模型,则是把生成详细推理过程这件事本身,变成了训练目标的一部分,让模型”学会”如何更好地思考,而不只是被提示着去思考。
核心的实现思路是用强化学习,针对有明确、可自动验证答案的任务(比如数学题、编程题)来训练模型。做法大致是:给模型一个问题,让它生成一段推理过程加最终答案,然后用一个自动化的验证器判断最终答案对不对(数学题看数值是否吻合,代码题看能不能通过单元测试),把这个”对/错”直接当作奖励信号,通过强化学习算法(比如PPO或DeepSeek-R1用的GRPO)去调整模型,让它更倾向于生成能得到正确答案的推理路径。这种方式的好处是奖励信号客观、不依赖人工标注偏好,可以大规模、低成本地生成训练数据——因为验证答案对错比生成高质量推理过程本身要容易得多。
DeepSeek-R1的论文里公开的一个有意思的发现是,即便完全跳过监督微调,单纯用强化学习去优化”能否得到正确答案”这一个信号(他们称之为R1-Zero),模型也会自发地学会拉长推理过程、进行自我检查和回溯(“等等,我再重新检查一下”这类自我修正的表述被观察到是训练过程中自发涌现的,而非人工设计),这说明”更长、更细致的思考”本身就是在强化学习优化正确率时自然会被选择出来的策略,而不需要显式地告诉模型”你要写长一点”。不过他们也发现纯RL训练出的模型存在可读性差、语言混杂等问题,所以正式版本还是先用少量高质量的长推理样本做一次监督微调”冷启动”,再叠加强化学习,效果和稳定性都更好。
除了训练阶段的变化,推理阶段也有一个关键概念叫”测试时计算扩展”(test-time compute scaling)。简单说就是:同一个模型,如果允许它在回答前多花一些计算量、多生成一些思考token,在难题上的表现会明显提升,这和”训练更大的模型”是另一条相对独立的性能提升路径。这也是为什么这类模型通常会给用户或开发者一个可调节的”思考预算”选项——预算越高,模型可能探索更多解法、做更多自我验证,准确率上升,但延迟和成本也随之增加。这条曲线背后的直觉类似于人做难题时多打草稿、多检查几遍确实更容易做对。
还有一些辅助性的技术路径也常被提到,比如用一个强的推理模型生成大量高质量推理过程,再”蒸馏”给更小的模型做监督学习,能让小模型也获得不错的推理能力,而不需要对小模型本身做昂贵的强化学习;另外像是过程奖励模型(对推理过程中每一步打分,而不只是看最终答案)、以及搜索类方法(比如在推理时对多条候选路径做树搜索或投票选择),在研究界也有大量探索,但从目前公开的信息看,像o1、R1这类主流长思考模型,似乎主要还是靠”结果导向的强化学习+模型在推理时隐式地展开一个较长的搜索/自检过程”这条路线取得的效果,而不是依赖显式的搜索算法。
需要说明的是,像OpenAI的o1/o3、Anthropic的Claude扩展思考模式这些具体产品背后完整的训练细节,大多没有完全公开,以上更多是基于DeepSeek-R1等公开论文、以及业界普遍讨论的方法论进行的归纳,具体到某个商用模型的确切实现,可能和这里描述的有出入。另外这个领域进展很快,以上是我截至训练知识范围内了解的情况,如果你需要了解某个具体最新模型的技术报告,我可以帮你搜索最新的公开资料。
讲一下chatgpt的L1到L5
ChatGPT的”L1到L5″其实不是ChatGPT产品本身的分级,而是OpenAI在2024年被媒体(彭博社等)披露的一套内部框架,用来描述通向AGI(通用人工智能)路上的五个渐进能力阶段。这套框架后来也被OpenAI自己在公开场合引用过,目的是给”我们现在的AI进展到哪一步了”提供一个相对具体的参照系,而不是笼统地说”还没到AGI”。
第一级是Chatbots(对话机器人)。这一级对应的是能进行自然语言对话、回答问题、协助完成写作和信息查询等任务的系统——也就是目前大多数人日常使用的ChatGPT这类产品的基础形态。它擅长语言理解和知识问答,但基本局限于”一问一答”式的交互,不具备主动规划和执行复杂多步任务的能力。
第二级是Reasoners(推理者)。这一级强调的是系统能像人一样进行更深层次的逻辑推理和问题求解,能处理数学、编程、科学等需要多步骤逻辑链条的复杂问题,而不只是基于模式匹配给出答案。这个阶段大致对应我们之前聊到的”长思考”推理模型,比如OpenAI的o1系列,被认为是L2能力的一个重要体现。
第三级是Agents(智能体)。这一级的系统不再只是被动回答问题,而是能够自主采取行动、代表用户完成实际任务,比如自己规划步骤、调用工具、执行操作,并能在数天时间跨度内独立完成一些复杂事务,而不需要人时刻在旁边逐步指导。OpenAI推出的一些具备浏览器操作、任务执行能力的产品方向,通常被认为是在往这一级迈进。
第四级是Innovators(创新者)。这一级设想的系统具备协助人类进行科学发现和创新的能力,比如能提出新的假设、设计实验、辅助推动某个领域的知识边界向前发展,而不仅仅是执行已有的既定任务。
第五级是Organizations(组织)。这是框架里设想的最高阶段,指AI系统具备了执行一个组织全部职能的能力,能够像一整个公司或机构那样自主运转、协调多方面工作,这基本上已经触及”通用人工智能”概念本身想要描述的能力范畴。
有几点需要说明清楚。第一,这套框架从一开始就带有相当的模糊性和推测性质,各级之间的边界并不像技术规格那样有清晰可验证的判定标准,更像是一种方便沟通进展的叙事工具,而不是严格的科学分级体系。第二,这是OpenAI内部使用、经由媒体报道后才广为人知的框架,并非正式的、经过同行评审的学术标准,业界其他机构不一定采用同一套划分。第三,关于”现在具体到了第几级””下一级何时到来”这类判断,本身争议很大,OpenAI官方也很少给出精确、可验证的自我评级,更多是把这个框架当作沟通愿景和路线图的工具。所以理解这套L1-L5,最好把它当作一个帮助大家讨论”AI进展方向”的参照坐标,而不是一把精确的量尺。
