LinkedIn Posts Scraper: publicaciones de empresa como filas estructuradas
El feed de LinkedIn de una empresa es uno de los pocos lugares donde una organización expone su propia posición, con sus propias palabras y con una regularidad predecible: lanzamientos, contrataciones, alianzas, financiación y las campañas que decide amplificar. Leer eso pestaña a pestaña no escala más allá de un puñado de cuentas. Este servicio apunta al mismo material a granel: envíe URLs o IDs de empresas de LinkedIn y las publicaciones de cada empresa vuelven como filas, una fila por publicación, con la interacción que reunió cada una junto al texto.
La referencia publicada documenta con claridad el lado de la solicitud. La entrada es una URL de empresa o un ID de empresa, y da ambas formas como ejemplos trabajados. Un ajuste de límite controla cuántos elementos vuelven por consulta y su valor por defecto es 100. Las solicitudes se agrupan como arrays de hasta 1.000 consultas. Lo que la referencia no hace es enumerar ni una sola columna de respuesta, y eso importa para el párrafo siguiente.
Esta es la posición honesta sobre la salida, dicha por delante en vez de enterrada. Tenemos en la mano catorce ejecuciones reales de este servicio y todas y cada una volvieron vacías. No es que sean escasas: cada hoja exportada declara su rango usado como A1 a I1, es decir, una fila de cabecera de nueve columnas sin datos debajo. Así que podemos publicar los nueve nombres que el export declara -la consulta enviada devuelta, el autor, el texto de la publicación, una columna de fecha de publicación, los recuentos de reacciones, comentarios y republicaciones, el enlace de la publicación y el identificador propio de LinkedIn- y no podemos mostrar una celda llena de ninguno de ellos. Todo en esta página se describe, por tanto, como declarado y no como confirmado. No hay tasas de relleno, ni valores de ejemplo, ni afirmaciones sobre formatos: ni si la columna de fecha lleva una marca de tiempo o una expresión relativa como «hace 2 semanas», ni si las cifras de interacción llegan como números o como cadenas de visualización tipo «1.2K», ni qué forma tiene el identificador de la publicación. Esas son las primeras cuatro cosas que resolver en una ejecución real, y las 500 filas gratuitas de una sola vez existen precisamente para que eso no cueste nada.
En lo legal, esto se sitúa en el extremo más ligero del catálogo sin ser ingrávido. Las publicaciones de empresa se publican deliberadamente, para lectura pública, y la entrada es una empresa y no una persona: los perfiles públicos de individuos son un servicio aparte con reglas más estrictas. Quedan dos cautelas. La columna de autor puede llevar a una persona con nombre en vez de a la organización, y un nombre asociado a una publicación es dato personal bajo el RGPD por muy pública que fuera, así que necesita una base jurídica y un plazo de conservación. Y el Contrato de Usuario de LinkedIn restringe la recopilación automatizada desde sus servicios; ese contrato es entre usted y LinkedIn, así que asegúrese de que su uso previsto es compatible antes de lanzar un trabajo grande. No corren rastreadores de terceros en la capa de datos, los exports se borran a los 30 días, y ni conservamos sus resultados ni construimos una base de datos a partir de ellos.