PostLog inSign upPostLog inSign up中国茉莉花 on X: "8月以来,不少ChatGPT用户发现,系统自动生成的会话标题末尾,偶尔会多出一些意义不明的外语单词,甚至是赌博、色情小广告的片段。一篇技术分析文章认为,这不是ChatGPT在测试广告功能,也没有隐私泄露的风险,但问题可以一直追溯到2024年。
类似的异常最早出现在OpenAI的Codex CLI上:1月底有开发者发现,使用GPT-5.3模型、上下文很长时,Codex给出的消息或代码里夹杂着中文博彩小广告;到4月,这类现象在开发者眼中已经司空见惯。OpenAI官方支持直到7月25日才第一次正面回应,说已经了解这一问题,预计会在未来的模型更新中解决。8月中旬,博彩广告开始出现在普通用户的会话标题里。
受影响最直接的是ChatGPT的用户,以及用OpenAI接口和Codex开发的人:类似的求助帖充斥OpenAI官方支持社区,受害者遍布全球。
文章推断,标题由一个比正文更轻量的推理模型单独生成,它写完标题后常常没能正常结束,就接着按概率输出下一个词。
文章认为,根源在分词器的词表。从2024年5月发布的GPT-4o开始,OpenAI把分词器编码方案从cl100k_base换成了o200k_base,把很多常见的中文词语和短句加进词表;但训练分词器用的中文语料里,有大量从色情、赌博和盗版影视网站抓取的数据,这些网站反复出现的固定广告词组,很容易被识别成单独的词元。
一篇入选自然语言处理领域会议EMNLP的论文发现,这个词表的4字词元里,68%是小广告;6字以上的词元,98%来自广告;最长的100个中文词元里,96个与赌博、色情或盗版影视相关。正式训练语言模型前,这些广告通常已被清洗掉,模型几乎没见过这些词元,也就不懂它们的意思。
文章说,随着模型更新,正文和思维链中的小广告已近乎绝迹;进入9月,标题中出现广告的频率也明显减少了。
(茉莉花快讯)"中国茉莉花@molihua_orgShow translation8月以来,不少ChatGPT用户发现,系统自动生成的会话标题末尾,偶尔会多出一些意义不明的外语单词,甚至是赌博、色情小广告的片段。一篇技术分析文章认为,这不是ChatGPT在测试广告功能,也没有隐私泄露的风险,但问题可以一直追溯到2024年。
类似的异常最早出现在OpenAI的Codex CLI上:1月底有开发者发现,使用GPT-5.3模型、上下文很长时,Codex给出的消息或代码里夹杂着中文博彩小广告;到4月,这类现象在开发者眼中已经司空见惯。OpenAI官方支持直到7月25日才第一次正面回应,说已经了解这一问题,预计会在未来的模型更新中解决。8月中旬,博彩广告开始出现在普通用户的会话标题里。
受影响最直接的是ChatGPT的用户,以及用OpenAI接口和Codex开发的人:类似的求助帖充斥OpenAI官方支持社区,受害者遍布全球。
文章推断,标题由一个比正文更轻量的推理模型单独生成,它写完标题后常常没能正常结束,就接着按概率输出下一个词。
文章认为,根源在分词器的词表。从2024年5月发布的GPT-4o开始,OpenAI把分词器编码方案从cl100k_base换成了o200k_base,把很多常见的中文词语和短句加进词表;但训练分词器用的中文语料里,有大量从色情、赌博和盗版影视网站抓取的数据,这些网站反复出现的固定广告词组,很容易被识别成单独的词元。
一篇入选自然语言处理领域会议EMNLP的论文发现,这个词表的4字词元里,68%是小广告;6字以上的词元,98%来自广告;最长的100个中文词元里,96个与赌博、色情或盗版影视相关。正式训练语言模型前,这些广告通常已被清洗掉,模型几乎没见过这些词元,也就不懂它们的意思。
文章说,随着模型更新,正文和思维链中的小广告已近乎绝迹;进入9月,标题中出现广告的频率也明显减少了。
(茉莉花快讯)2:30 AM · Oct 11, 2026·53ViewsLog in or sign up for XSee what’s happening and join the conversation
Continue with phoneContinue with AppleContinue with Google or Log in with username or emailRelevant people中国茉莉花@molihua_orgFollow招收志愿者,请发Email联络:[email protected]。欢迎聊天、私信Trending nowTerms·Privacy·Cookies·Accessibility·US TIDA·Ads Info·More© 2026 X Corp.