发布日期:2026-08-24 06:57 点击次数:126
最近公众号的质料就越来越差,每天的午饭齐不香了,约莫是 AI 惹的祸;遂把推流的公众号往 AI 检测器具一放,果如其言 100%,就说奈何不下饭云开体育,蓝本是没东说念主味了。
尝试AI 就不可生成一些脍炙东说念主口的著述吗? 上手!
1.先来写个比方:
伸开剩余91%对比一下史铁生的:
日子总在往日,成为一张张作废的卡片。失恋,是一团烟雨,心灵的一起生分又熟习的背景"心如刀割"获胜使用谚语抒发感受,莫得簇新感,鄙俗中阻遏深度。
2.象征:
对比一下鲁迅的:
秋天的后深宵,月亮下去了,太阳还莫得出,只剩下一派乌蓝的天;除了夜游的东西,什么齐睡着。华老栓忽然坐起身,擦擦洋火,点上遍身浓重的灯盏,茶楼的两间房子里,便弥满了青白的光。"要变天了"很直白,获胜点题,不如 "擦洋火"、点灯这些示意更有田地。
3.非线性叙事
对比一下马尔克斯的:
多年以后,奥雷连诺上校站在行刑队眼前,准会念念起父亲带他去参不雅冰块的阿谁远方的下昼打破获胜被揭晓,撒了谎,开局整的和收尾不异,莫得悬念感。
Transformer 初探试了试,如实差点真谛。咱们从期间的角度望望,为啥会造成这样。
大家皆知,现如今的 LLM 绝大广博齐是基于 Transformer 架构的。
职责历程咱们先来粗造了解一下它的职责历程。
约莫便是每次生成从候选词列表中接管一个 token 四肢输出,这个此次输出四肢下次输入。要津点在于采样输出是奈何接管的。
早期的 llm 通过 Top-k 加温度四肢采样计谋,自后引入了 Top-p 等其他厚爱的拔除计谋。
Top-k 采样Top-k 比拟粗浅,便是把候选词按照概率从高到低排,取前 k 个。
温度假定唯有 Top-k 采样,会发生什么?会造成每次齐从k个元素中接管,而top1会被更高概率接管,导致输出重叠度比拟高。
为了让输出愈加丰富,不这样单调,需要引入新的采样计谋,让低概率的词也可能被接管到。
假定有一个参数,
值小的期间介怀一些,接管概率高的,支吾一些严谨性高的场景(如编程) 值大的期间万般一些,接管概率低的,支吾一些丰富性高的场景(如写稿)为了便捷形容,咱们姑且先称这个参数为T。
也便是说
T小的期间,咱们需要让低概率词的被接管的契机变小,也便是放大低概率词和高概率词的差距,轶群出众。 T大的期间,咱们需要让低概率词的被接管的契机变大,也便是减弱低概率词和高概率词的差距,众生对等。除法什么运算不错竣事这种缩放后果呢?最朴素的,便是除法。咱们用 $$x_$$ 流露词汇表中第 i 个词的概率(术语叫logits), $$y_$$ 流露第 i 个词温度退换后的概率,有底下这样的公式。
$$y_i = \frac{x_i}{T$$
指数函数咱们知说念,概率之和应该为1。为了让概率之和变为1,咱们需要用 刻下概率 除以悉数概率的和得到新的概率(归一化)。
智谋的你可能依然念念到了,等比例缩放一朝归一化,咱们悉数缩放齐莫得道理了。比如:[5,3,2] 不管咱们奈何使用除法,归一化齐会造成[0.5,0.3,0.2]。
显着,咱们需要再引入一个非线性变化,让咱们缩放不失效,咱们接管使用指数函数。
$$z_i = e^{y_i$$
例如讲明一下
咱们的缩放不再被归一化对消,平均概率差距也被拉大了。
总结这里咱们依然得到了温度缩放的Softmax公式:
$$\sigma(\vec{x})_i = \frac{e^{\frac{x_i}{T}}}{\sum_{j=1}^{n} e^{\frac{x_j}{T}}$$
这个公式对应上头提到的三个要领:
使用除法竣事缩放,即轶群出众和众生对等。$$y_i = \frac{x_i}{T$$
$$z_i = e^{y_i$$, 指数函数让缩放不被归一化对消。
$$P_i = \frac{z_i}{\sum_{j=1}^{n} z_j$$ ,归一化过程(让悉数概率的和为一)。
T为什么称之为温度呢?这里T小 对应介怀,T大对应活跃,这和温度的物理道理是一致的,温度越高,分子热通顺越剧烈,立地性越强(熵越高)。
引入温度之后相通的问题,也会有不同的回复。
耀宗旨机制咱们知说念,一句话中不同词 孝顺的信息量是不同的,相通的词在不同的句子中孝顺的信息量亦然不同的。例如讲明:
她衣裳蓝色外衣。这里“蓝色”的信息量 要低于“外衣”的信息量,它仅仅外衣的形容词 桌上放着三把钥匙——蓝色的那一把能怒放保障箱。这里“蓝色”的信息量就很高了,获胜决定哪个钥匙是有效的。这个信息量很好相连,但很难直不雅的使用数学形容,让咱们换一个神气表述问题,关于要臆度的下一个词, 咱们需要知说念哪些词 和咱们要臆度的词酌量度更高。
这些词在底层是使用向量存储的,咱们奈何判断两个向量是否酌量呢?没错,便是看向量的夹角,夹角为90度就毫无联系,为0度便是高度酌量。
进而,咱们使用投影来计较酌量度。
$$\vec{a} \cdot \vec{b} = \|\vec{a}\| \|\vec{b}\| \cos\thet$$
llm 恰是通过通过投影来使得不同词对臆度token的影响不同 , 这就和咱们在听别东说念主言语时,和会过耀宗旨放在要点词上不异,这种机制称之为耀宗旨。
耀宗旨机制 (Attention Mechanism) 输入序列 她 衣裳 蓝色 外衣 Query [臆度位置] 耀宗旨权重分拨 0.1 她 0.2 衣裳 0.3 蓝色 0.4 外衣 向量相似度 Query 外衣 θ₁ 蓝色 θ₂ 她 θ₃ θ₁ < θ₂ < θ₃ 夹角越小,酌量度越高 中枢机较 1. 相似度: score(Q,K) = Q·K / √d 2. 权重: weight = softmax(score) 3. 输出: output = Σ(weight × V) 不同语境下的耀宗旨分拨 例1: "她衣裳蓝色外衣" 她 衣裳 蓝色 外衣↑ 例2: "蓝色的钥匙能怒放保障箱" 蓝色↑ 的 钥匙 能怒放 耀宗旨权重会把柄潦倒文动态解救
总结这里咱们能够了解了 Transformer 的结构, 这东西对能不可写好著述有啥影响呢?
运行概率分辨本体上来自考试语料,大部分东说念主并不是体裁造诣深厚的东说念主,只消语料的专科性和准确性没问题,齐会被考试。这意味着,运行概率分辨中,体裁性形容匮乏、枯竭诗意、大部分齐在平铺直叙,而体裁缺需要一些创意。 要是要给 llm 更多的可能,直不雅的不错将温度调高(要是你是用 API 调用,一般默许为1),本体上后果并不好,因为更多的照旧受运行概率分辨影响,温度退换带来的后果比拟有限。 剩下的便是这个耀宗旨机制了,不同的输入对输出的影响很大,这意味着明确的条件、淡雅的职责门径会让 AI 的表现变好。回顾一下这个例子,回复比第一个的心如刀割许多了。可是耀宗旨机制的影响在著述变长后表现并不好,就像我但愿同期听 10 个东说念主言语,谁也听不清,而好的著述是需要宏不雅的全文头绪把控的。
终末总结一下:
英国艺术表面家克莱夫·贝尔 在《艺术》中提议"艺术是专门味的神气",而不可名状的热枕,不同寻常的刻意偏离是 AI 夸不外去的门槛。靠着效法名家写稿立场赢得的粗造仿品云开体育,无法承载咱们唯独无二的人命体验。 AI 偶然有爆款著述,但却恒久写不出好著述。
发布于:陕西省