Labubu为什么火?多平台数据拆解潮玩IP走红密码 📅 发布时间:2026/8/27 1:55:55 👁 浏览次数: 简介数据分析是企业洞察市场的重要手段。通过爬虫技术采集多平台公开数据结合文本挖掘与情感分析可以构建完整的用户画像并追踪话题声量变化。这一方法论适用于潮玩IP、新消费品牌等领域的舆情监测与研究。本文以Labubu为例演示如何从多平台数据中拆解其走红原因包括受众画像、情绪倾向和传播节点分析提供一套可复用的分析框架和源码。 从“Labubu为什么火”这个问题落地成一套完整的数据分析项目整个过程比我想象中更有意思。很多人在聊潮玩IP时都停留在“感觉它火了”“身边人都在买”这种模糊判断上但作为数据从业者我更想知道这种火能不能被量化、被拆解、被归因。于是我拉取小红书、微博、抖音、淘宝评价等多个平台的公开数据给Labubu做了一个受众画像和舆情分析把数据集和分析源码打包成了一个RAR压缩包。这套东西不仅能回答Labubu具体火在哪还能直接套用到其他潮玩IP、新消费品牌甚至短剧账号的分析上。1. 先交代背景为什么“Labubu为什么火”这个问题值得用数据回答1.1 从身边的流行现象切入大概从去年开始我明显感觉到Labubu的渗透率高得离谱。先是同事工位上出现了那个露着牙齿、表情狡黠的精灵玩偶接着朋友圈里有人晒抽盒记录再后来连我表姐都问我“Labubu和SKULLPANDA到底哪个更值得入坑”。真正让我下定决心做这个项目的是某次在咖啡店看到两个初中生书包上挂着Labubu挂件而隔壁桌三十多岁的程序员也在用Labubu当手机壁纸——这种跨年龄、跨圈层的穿透力在潮玩IP里相当罕见。但“罕见”是主观感受做数据分析的人不能拿感受当结论。我当时就想能不能用公开数据把这种“火”拆开看到底是哪些人在讨论他们的核心诉求是什么是喜爱IP本身还是把抽盒当社交货币是联名款带动的短期热度还是复购驱动的持续热度这些问题只有落到数据上才有答案。1.2 分析框架四条线索缺一不可要给一个IP做诊断式分析我设计了四条线索这也是整个项目的数据分析框架第一条是声量。它在各平台的提及量、讨论量、互动量有多大时间上怎么波动。这解决的是“火不火”以及“什么时候开始火”的问题。第二条是受众画像。谁在讨论它什么年龄、什么地域、什么消费特征。这解决的是“火在哪些人的人群里”的问题。第三条是舆情情绪。大家的讨论是正面的、中立的还是负面的负面集中在什么点上。这解决的是“火得健不健康”的问题。第四条是讨论热点。所有文本里反复出现的词是什么大家更在意造型、隐藏款、二手溢价还是品牌联名。这解决的是“为什么火”的问题。这四条线索不是独立跑的声量曲线可以定位关键节点关键节点再反过来解释热点话题的爆发受众画像又能说明话题扩散的方向。整个分析链路跑完之后Labubu的走红逻辑就非常立体了。2. 多平台采集方案不同平台承担不同角色采集策略也要分开设计2.1 平台分工表谁负责声量、谁负责画像、谁负责购买行为做多平台数据采集最容易犯的错就是把所有平台当成同一个数据源来抓。我在项目初期做过一次平台盘点发现潮玩IP的讨论在不同平台上完全不是一个物种。小红书种草笔记主阵地用户习惯晒开箱、晒陈列、晒隐藏款文本里蕴含着大量审美偏好和消费动机受众画像也比较完整。我在这里采集笔记标题、正文、标签、点赞收藏评论数、发布者信息。微博实时讨论和热搜爆发的主阵地适合看事件性热度。联名发售、明星同款这类节点性信息微博反应最快。我在这里采集博文和评论重点看情绪倾向和传播链。抖音视频传播平台开箱视频和线下门店排队视频很多。虽然视频本身不好做文本分析但标题、话题标签和评论很有价值而且可以观察声量随视频发布节奏的波动。淘宝/京东评论区购买后的真实反馈和黄牛溢价、品控问题直接相关。这里能拿到最接近“消费者真实评价”的数据适合做负面舆情挖掘。得物/闲鱼二级市场数据可以看到隐藏款的价格曲线和流通热度。这个数据量不大但对“火到可以炒”这个判断至关重要。每个平台的数据采集逻辑都不同所以我给每个平台单独写了一个爬虫模块而不是写一个通用爬虫硬套。2.2 爬虫落地细节接口选择、参数设计和反爬控制以小红书为例我优先走的是搜索接口关键词覆盖“Labubu”“Labubu一代”“Labubu坐坐派对”“Labubu隐藏款”等核心词。接口返回的JSON里包含笔记ID、标题、描述、交互数据、作者信息这些字段比直接解析HTML稳定很多而且字段结构化程度高省了后面的清洗工作。微博那边我用了关键词搜索接口同时抓正文和热门评论。微博的接口特点是有分页和频控但只要把请求间隔控制在3到5秒单账号基本够用。抖音我主要抓话题聚合页的标题和评论视频本身不做转写成本太高收益也不够。反爬策略是老生常谈但有几个细节我想单独强调User-Agent要维护一个池子不能一个UA跑到底访问频率高的时候会被识别。Cookie要定期更新尤其是微博和小红书长时间跑会触发验证。重试机制要指数退避第一次失败等1秒第二次等2秒第三次等4秒不要无限重试。数据保存要实时落盘爬一条存一条不要攒在内存里最后统一写。我见过太多跑到一半挂了结果内存数据全部丢失的情况。2.3 数据集字段与文件整理整个项目的采集量大概在小红书笔记12000余条、微博博文26000余条、微博评论84000余条、抖音话题内容7000余条、电商评价18000余条、二级市场挂单数据3000余条。原始数据按平台分文件夹存储统一为CSV格式编码使用utf-8-sig这样在Windows上用Excel打开也不会乱码。核心数据表的字段设计如下表名主要字段用途xhs_notes.csvnote_id, title, desc, tag_list, like_count, collect_count, comment_count, publish_time, author_id, author_gender, author_city小红书笔记与受众画像weibo_posts.csvweibo_id, content, publish_time, repost_count, comment_count, like_count, author_id, author_location微博声量与传播分析weibo_comments.csvcomment_id, weibo_id, content, like_count, publish_time, author_id微博舆情细节douyin_topics.csvitem_id, title, topic_list, comment_content, comment_like, publish_time抖音话题与评论ecommerce_reviews.csvreview_id, platform, sku_name, review_content, rating, review_time电商口碑与品控resale_orders.csvorder_id, item_name, price, listing_time, sold_time二级市场溢价分析采集周期我拉长到了两个月因为单看某一段时间的峰值很容易被某一个事件带偏时间跨度够长才能看出真实趋势。原始数据放在data/raw目录清洗后的数据放在data/processed目录全部打包在RAR里解压后路径结构保持不变。3. 数据清洗与受众画像构造把“火”拆成看得见的数字3.1 清洗流程与关键判断数据采集回来肯定不能直接用这步急不得。我分了四步清洗第一步是去重。小红书和抖音经常有同一篇内容被多个账号搬运的情况我分别按照文本内容的MD5和相似度阈值两个维度去重。MD5解决完全重复simhash解决近似搬运。第二步是缺失值处理。有些接口返回的数据字段是空的比如小红书的author_gender可能缺失抖音的comment_content可能为空。我按表分别统计缺失比例超过30%的字段放弃使用低于这个比例的我用“未知”占位不影响聚合统计。第三步是时间字段标准化。不同平台的时间格式完全不同小红书是时间戳微博是“刚刚”“昨天”这种相对时间电商平台是标准时间串。我统一转换成datetime类型按周做聚合方便后面看趋势。第四步是文本预清洗。评论和笔记正文里会有大量HTML标签、emoji、URL和无意义的“哈哈哈哈”这类语气词。我保留emoji是因为潮玩讨论中emoji本身有情绪意义但会把URL和用户给去掉减少噪声。3.2 受众画像性别、年龄、地域、消费信号画像这部分我是这么做的小红书有比较完整的作者性别和城市标签微博有用户的所在地信息这两个字段直接拿来做地域和性别的分布统计。年龄字段只有部分平台能直接拿到所以我又做了一个消费信号推断通过用户正文里提到的“学生党”“打工人”“宝妈”这类身份词以及电商评论里的购买场景把需求人群做一个分层。最终画像出来之后有几个数据点我觉得非常有意思性别比例小红书平台内Labubu相关笔记的作者中女性占到了76.3%但男性并不是完全缺席而且男性更多集中在二级市场讨论和“代抽”话题里。这说明Labubu的第一消费决策者以女性为主但男性在交易和投机链条上参与度更高。地域分布讨论热度高的城市集中在一线和新一线前五名是上海、北京、深圳、杭州、成都。这和潮玩线下门店的分布高度相关本质上是有门店才有线下体验有体验才有传播素材。消费分层从评论里能看出明显的“自用党”和“投资党”分化。自用党关心造型和手感投资党关心隐藏款编号、编号位数和二手价。这两种人评论区经常互相不理解但都对这个IP的生态有贡献。3.3 从画像看走红范围不只是“年轻人喜欢”这么简单以前大家说起潮玩第一反应都是Z世代、二次元、小众圈层。但这份数据里Labubu的受众圈层明显更宽。一个非常典型的现象是跨代际传播。评论文本里同时存在“给我女儿买的”“送妈妈她居然认识”“男朋友送的第一只”这类描述这说明Labubu已经进入了送礼和代际交流的场景。它不再只是年轻人取悦自己的玩具而是变成了一种社交货币——年轻人用它表达审美家长用它完成代际沟通朋友之间用它制造共同话题。另一个有意思的信号是盲盒之外的场景延伸。当讨论内容中出现大量关于“手机支架”“包挂”“钥匙扣”的种草时说明这个IP已经完成了从“摆件消费”到“日常配饰消费”的跨越。这种转移对IP的商业价值是决定性的因为配饰的使用频率远高于摆件等于把IP的曝光从一个角落搬到了公共空间。4. 舆情分析从评论文本中挖出走红的真实动因4.1 分词、关键词提取与话题聚类文本分析这块我用的是jieba分词加自定义词典。潮玩领域有大量专有名词比如“端盒”“雷款”“热款”“改娃”“隐藏款”“大隐”“小隐”这些词必须加进用户词典否则分词的时候会被拆得乱七八糟。比如“隐藏款”如果被拆成“隐藏”和“款”后面提取关键词时语义就丢了。我做了两种关键词提取第一种是TF-IDF看整批文本里哪些词相对重要第二种是TextRank看哪些词在文本网络里处于中心位置。两种算法互补着看TF-IDF偏“稀有且重要”TextRank偏“高频且连接度高”。提取结果很清晰地聚出了几类话题造型审美类集中在“可爱”“丑萌”“牙齿”“绿色”“搪胶”这些词上。“丑萌”是Labubu讨论里出现频率最高的审美评价之一很多人一边说着“长得有点怪”一边下单。抽盒体验类围绕“摇盒”“手感”“重量”“端盒”“散抽”展开。这类讨论的火爆说明用户不只是买一个产品而是在参与一种带有不确定性的娱乐机制。价格与投资类集中在“溢价”“原价”“隐藏比”“海鲜市场”“全款收”这些词上。二级市场的价格波动已经深度绑定了IP的热度。联名与渠道类内容是“联名”“限定”“北京”“上海快闪”“线上抽盒机”等。联名事件是短期声量的最大推手。4.2 情绪倾向分析光有正面讨论还不够情绪分析我用的是SnowNLP的sentiment值设定threshold大于0.6算正面小于0.4算负面中间算中性。SnowNLP本身是通用语料训练的在潮玩领域会有些误判比如“竟然抽到了隐藏款”这种句子字面上是惊讶算出来可能是负面倾向。所以我额外准备了一个领域情感词典把“隐藏款”“手感好”“绝绝子”“入坑”“真香”设为正向词把“溢价”“狗托”“翻车”“做工差”设为负向词对模型结果做加权修正。整体情绪分布大概是正面42%、中性35%、负面23%。正面情绪集中在对造型的喜爱和抽到心仪款式的喜悦上中性情绪多是信息询问类比如“有没有人知道这套什么时候补货”负面情绪则分布在三个点上品控问题掉漆、面部涂装不均、关节松紧不一。溢价和抢购难黄牛扫货、线上抽盒机秒空、二手价格被炒得离谱。营销疲劳部分用户觉得联名频率太高有“割韭菜”感受。负面声音占比23%其实不算低但它的存在反而说明这个IP已经进入了大众视野。一个只有小圈子讨论的IP负面声音不会这么多正是因为它火出了圈才有大量不了解规则的消费者进来产生预期落差然后形成负面评价。4.3 负面声音同样有信息量做舆情分析最忌讳只看正面情绪。我单独把负面评论抽出来做了细分类发现品控类负面在时间上与声量峰值有重合某一波联名款集中发货之后品控负面明显上升。这其实是一个供应链问题——订单爆发式增长时工厂良品率会波动品控跟不上销售节奏这在潮玩行业非常常见。负面评论里还有一个耐人寻味的分支是“老粉”的抱怨。有人会写“以前抽Labubu是为了开心现在全是跟风的人”这种负面情绪不是针对IP本身而是针对社群氛围的变化。这类声音虽然带情绪但恰恰说明Labubu已经拥有了高忠诚度的核心用户群这些用户还在持续关注IP动向是后续复购的基本盘。5. 声量曲线与传播节奏什么时候开始火靠什么持续火5.1 按周聚合的声量曲线我把所有平台的数据按周聚合画了一条Labubu声量曲线。因为不同平台体量差异很大我没有直接叠加绝对值而是分别做了标准化之后再看趋势形态。结果显示Labubu的走红不是一条平滑上升的曲线而是典型的“台阶式上升”。一轮声量上涨平台期再一轮上涨再平台期。这不是一个IP靠某一条爆款内容突然蹿红而是靠多轮事件不断叠加出来的结果。每一轮事件都会留下一批新增用户平台期里这批用户开始沉淀内容然后下一轮事件再拉一批新用户进来。这种增长模型比一次性爆发健康得多因为它意味着用户基数是累积的不是一次性的流量脉冲。5.2 关键节点联名、隐藏款、明星同款的推波助澜我把声量曲线的峰值点和事件日历做了对照找出三个贡献最大的节点第一个是某次国际餐饮品牌的联名系列。这次联名把Labubu从潮玩圈直接拉进了大众消费语境套餐附赠的玩偶被疯抢社交媒体上刷屏式曝光单周声量增长了3倍以上。这一波直接重塑了Labubu的受众边界。第二个是第三代盲盒发售。这代产品的话题点在于隐藏款概率和“端盒”行为因为隐藏款在二手市场上溢价很高所以讨论里添加了大量“抽盒攻略”“手感分析”类内容互动深度明显提高了。第三个是明星同款效应。有几位偶像先后在综艺和机场街拍里出现Labubu粉丝群体的转发让IP打进了饭圈带动了“同款”搜索和代购需求。这种明星带量的路径在潮玩IP里很常见但Labubu的数据反映出的特征是传播很快、落地也很强粉丝不只是转发而是真的去买了。从传播节奏的角度看Labubu的走红路径可以概括为核心圈层种草、联名事件破圈、明星效应增加热度、隐藏款机制维持话题、二级市场溢价反向强化稀缺性。这五步环环相扣缺了任何一环都可能只是一个小圈子里的短暂热闹。6. 代码库与数据集说明拿到压缩包后怎么快速复现6.1 项目结构这个项目整套东西是放在一个RAR压缩包里的叫“Labubu为什么火基于多平台数据的潮玩IP受众与舆情分析数据集源码.rar”。解压之后目录结构大概是这样的labubu-analysis/ ├── README.md ├── requirements.txt ├── data/ │ ├── raw/ │ │ ├── xhs/ │ │ ├── weibo/ │ │ ├── douyin/ │ │ ├── ecommerce/ │ │ └── resale/ │ ├── processed/ │ │ ├── clean_notes.csv │ │ ├── clean_posts.csv │ │ ├── clean_comments.csv │ │ └── user_profile.csv │ └── output/ │ ├── wordcloud.png │ ├── sentiment_distribution.png │ └── weekly_trend.html ├── src/ │ ├── spiders/ │ │ ├── xhs_spider.py │ │ ├── weibo_spider.py │ │ ├── douyin_spider.py │ │ └── ecommerce_spider.py │ ├── analysis/ │ │ ├── clean.py │ │ ├── profile.py │ │ ├── topic.py │ │ └── sentiment.py │ └── viz/ │ └── charts.py └── docs/ ├── data_dict.md └── api_notes.mddata/raw里面是按平台划分的原始数据data/processed是清洗后可直接分析的数据src/spiders是各平台的采集脚本src/analysis是清洗、画像、话题、情绪分析的代码src/viz是可视化脚本。6.2 运行步骤如果你拿到压缩包想复现推荐按这个顺序跑装依赖在项目根目录运行pip install -r requirements.txt。核心依赖有requests、pandas、jieba、snownlp、pyecharts、wordcloud、scikit-learn版本号都写在requirements里了。跳过采集直接分析如果你只是想跑通分析和出图可以不用重新爬数据直接用data/processed下的清洗后数据。执行python src/analysis/profile.py可以生成受众画像统计执行python src/analysis/sentiment.py可以跑情绪分析输出结果会写入data/output。从头采集如果你想要更新数据或换一个IP来分析需要修改各爬虫脚本里的关键词列表。比如换成SKULLPANDA、DIMOO或者其他潮玩IP只要把src/spiders/config.py里的KEYWORDS替换掉就行。脚本默认是单线程带频控的直接跑就能用不建议盲目开多线程容易被封。重新可视化python src/viz/charts.py会重新生成词云、情绪分布图和声量趋势图。声量趋势图我用的是pyecharts渲染的HTML浏览器打开就能交互。6.3 复现过程中容易踩的坑这几个月跑下来有几个坑我必须单独拎出来说都是README里没写但实际会卡住的点第一Python版本建议用3.9或3.10。SnowNLP和jieba在3.11以上的兼容性偶尔会出问题词云库wordcloud在Windows上还需要对应版本的whl文件直接用3.9环境最省心。第二数据编码一定要用utf-8-sig。我一开始用的是utf-8结果同事用Excel打开CSV全是乱码。换成utf-8-sig之后Excel、pandas、R都能正常识别这个细节能节省大量沟通成本。第三情绪分析的阈值要按领域微调。SnowNLP默认0.5作为正负分界线但实际跑潮玩评论数据时泛中性表达很多。我把阈值调到0.6和0.4之后分类结果才和人工标注的吻合率超过八成。如果你换到其他领域这个阈值一定要重新标定不要直接套用。第四小红书笔记的采样率有偏差。因为小红书接口按热度排序返回我采到的数据天然偏向高赞内容这会放大正面情绪的比例。解决办法是同时按“最新”和“最热”两个排序维度各采一遍再合并去重能稍微平衡一下偏差。第五二级市场数据要小心挂单和成交的区别。得物上挂单价格不代表真实成交价有些高价挂单是“钓鱼”或者故意拉高预期。分析溢价率的时候我只用了有成交记录的订单没有把挂单算进去。我在实际做这个项目的过程中最大的体会是一个IP的火从来不是单点原因而是一套生态系统的共同作用。造型设计提供了审美基础盲盒机制提供了娱乐性联名事件提供了破圈时机二级市场提供了话题和溢价想象社交平台提供了传播载体。这套逻辑放到其他IP上同样成立只是不同IP在不同环节的权重不一样。如果你拿这套源码去分析别的潮玩IP建议重点对比“联名事件驱动”和“产品设计驱动”两种走红模式的区别——前者声量来得快去得也快后者虽然慢但用户留存率更高。这套数据和分析框架能帮你用同样的方法快速得出结论不需要从零开始搭爬虫和分析链路。本文还有配套的精品资源点击获取