Perplexity 的答案层下面藏着来源层。对做 GEO 看板、内容研究工具或品牌可见度监控的开发者来说,引用列表往往比正文本身更值钱。难点在于持续稳定地拿到这层数据——消费端界面动态渲染,答案和来源是分批到达的,你要的信息散落在答案文本、网页结果、相关提示和富媒体里。
Scrapeless 的 Perplexity actor 把这层表面转成结构化 JSON。你只需要向一个 HTTP 端点发送提示词、国家和网页搜索开关,响应会回到与其他 LLM Chat Scraper actor 相同的 {status, task_id, task_result} 信封里。
![]()
返回字段里哪些值得注意
顶层信封是共享的,但主要字段是平台专属的。每个可选数组都要按可空处理:一个研究型提示可能返回丰富的网页结果集,另一个查询可能完全没有媒体项。当前字段参考见 Perplexity Scraper 文档。
前置条件
- 一个 Scrapeless 账号和 API key
- curl 用于第一个请求
- Python 3.10 或更新版本用于完整示例
- Python requests 包
把 key 设在 shell 环境变量里,不要写进脚本:
export SCRAPELESS_API_KEY=your_api_token_here
用 curl 发一个 Perplexity 请求
Perplexity 使用 scraper.perplexity actor。请求体是共享的 {actor,input} 结构。三个输入字段各司其职:prompt 是要发送的问题,country 固定住宅出口市场,web_search 控制这次运行是否走 Perplexity 的网页接地答案路径。如果数据要跨时间对比,同一系列里三个值都要保持不变。
理解响应结构
示例响应展示了文档化的字段布局,并不声称这些值来自某个具体的实时提示。响应里 task_result 包含 prompt、result_text、related_prompt、web_results 和 media_items。其中 web_results 是来源列表,每项有 name、url 和 snippet。media_items 在示例里是空数组,实际查询中可能为空也可能有内容。
把 task_id 和载荷一起存下来。同一个提示跑多次时,它给每次抓取一个稳定的审计键。接下来写一个可复用的 Python 客户端,返回规范化记录的同时保留原始 task_result 供后续分析。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.