Scraper les données de vidéos TikTok
Le TikTok Videos Scraper prend une URL de vidéo et renvoie une ligne de douze colonnes : query, video_id, author, description, create_time, likes, comments, shares, plays, saves, reposts et url. Six exécutions se trouvent derrière cette page, et elles montrent deux choses clairement. La première est que le schéma s’est étoffé : les exécutions jusqu’au 3 juillet renvoyaient dix colonnes, celles à partir du 14 juillet en renvoyaient douze, avec l’ajout de saves et reposts. Rien n’a été supprimé ni renommé : un importeur écrit pour l’ancienne forme charge toujours - il lui manque simplement deux colonnes, ce qui plaide pour épingler les champs dont vous avez besoin plutôt que de lire par position.
La seconde est une lacune dans nos propres tests, et nous préférons l’étiqueter que la cacher. Aucune des six exécutions n’a soumis une vraie URL de vidéo TikTok. Les entrées étaient la page d’accueil de TikTok, une page de profil, un chemin incomplet et trois identifiants de vidéo soit manifestement fictifs, soit réellement inexistants. Toutes les colonnes de données sont donc vides, et c’est un fait sur ce que nous avons demandé plutôt qu’un constat sur le service. Il n’y a nulle part sur cette page de chiffres d’engagement, de noms d’auteurs ou de lignes d’exemple, car en produire reviendrait à les inventer.
Il vaut la peine de distinguer cela de nos autres services TikTok. Les scrapers hashtags et recherche sont réellement entravés : tous deux renvoient une colonne de statut expliquant que TikTok sert ces listes via une API à requête signée plutôt que dans le HTML de la page. Rien de tel n’est apparu ici. Le service a au contraire répondu différemment selon ce sur quoi il pointait - no data pour une page d’accueil ou un profil, et item doesn't exist (removed / private) pour un identifiant de vidéo bien formé sans vidéo derrière. Distinguer deux modes d’échec, c’est ce que fait un analyseur qui fonctionne : la lecture raisonnable est donc un service opérationnel à qui l’on donne de mauvaises entrées, et non un mur.
Une observation de plus pour qui veut bâtir dessus : la colonne url était identique octet pour octet à query à chaque exécution. Elle rend votre entrée au lieu de résoudre une adresse canonique : elle ne normalisera donc pas les liens courts et ne suivra pas les redirections. Et description, censée porter la légende, portait une chaîne de statut lors des six exécutions - lisez-la avant de traiter une ligne vide comme un échec silencieux, car c’est elle qui vous dit si la vidéo a disparu ou si l’URL était mauvaise. Uniquement des pages publiquement accessibles, aucun traceur tiers sur la couche de données, et les exports sont supprimés automatiquement au bout de 30 jours. Vos 500 premières lignes sont gratuites et ne nécessitent aucune carte bancaire - le moyen le moins cher de répondre à la question à laquelle cette page, honnêtement, ne peut pas répondre.