杨植麟的采访笔记
19:00
大模型师人类文明的放大器
缸中之脑:把一个大脑放到鱼缸里面
AI一天,人间一年
一些东西变得清楚了:强化学习的范式,如何去做让模型有更强的推理能力,有更强的agentic的能力,当初只是想让预训练如何更好。
RLHF如何在对话的体验中如何做得更好。
The begining of infinity
把模型作为一个放大器,一方面是产出,一方面还是输入或者工具,相当于自举,go语言其实是go语言开发出来的
问题持续产生,你就持续解决问题
追求的是攀登的过程,或者是你越爬越高,动态进化的过程。
终点是AGI么?
AGI是个方向,是模糊的,但是登月是一个明确的,具体的目标,两个不一样。
技术对于人类社会的影响,可能是更长周期的事情,你也可以认为它是AGI的一部分。
有那些人工智能范式级的变化?
长思考的推理模型,O1作为第一个,让模型在推理的过程中做更多的尝试和反思。
反思实际上是两种能力:1. 提出一个新的猜想,会得到自我的验证,需要有一定的验证能力。猜想验证很多次,得到一个答案
等价的把pass k变成了pass 1
我觉得有必要做一个应用:你应该知道的。。。
自由探索的过程,不是一个线性的过程?
有效的工作方式还是比较线性的,使用被验证过的猜想,
结合并行和串行两种不同的方式。
最近有paper讲串行的上限会更高。跟他们的实验结论相关。但还是一个缸中之脑。不需要跟外界交互。
缸中之脑不需要跟外界交互就能解一道题。
有多轮的,给予强化学习的范式,agentic模型会跟外界做很多交互。边思考边做一些操作。通过多轮的方式解决一个问题,就不再是缸中之脑。
它是跟外界有交互的,它下一个行为是通过交互得到的交互给他的反馈,状态的更新是有关系的。这就是推理的过程。
这两个东西都指向了同一个东西:test-time scaling,测试的时候或者推理的时候做更好的规模化。
基于长思考的强化学习和agentic的强化学习本质上都是一种规模化预测token的方式。
有一个很有意思的趋势:会有越来越多的模型公司做一种一方的agent产品,一方是first party
说的是openclaw这种agent产品,它逆向了模型公司的开发和使用过程。
chatgpt的L1到L5:
1. chatbot对话机器人
2. reasoners,推理者
3. Agents,智能体,
4. Innovators
5. Organization
明天继续
