{"id":16174,"date":"2025-11-27T11:57:00","date_gmt":"2025-11-27T09:57:00","guid":{"rendered":"https:\/\/festibity.com\/general\/ithinkupc\/"},"modified":"2026-01-23T14:44:40","modified_gmt":"2026-01-23T12:44:40","slug":"ithinkupc","status":"publish","type":"post","link":"https:\/\/festibity.com\/es\/noticies-partner\/ithinkupc\/","title":{"rendered":"IThinkUPC"},"content":{"rendered":"<p><span><em>L\u2019entrenament de models d\u2019IA afronta una limitaci\u00f3 cr\u00edtica: la manca de dades p\u00fabliques de qualitat.<\/em><\/p>\n<p>La intel\u00b7lig\u00e8ncia artificial avan\u00e7a r\u00e0pidament, amb models cada vegada m\u00e9s sofisticats. Cada pocs mesos apareixen models m\u00e9s potents i precisos, capa\u00e7os de generar text, imatges, codi i raonament complex. Tanmateix, darrere d\u2019aquest progr\u00e9s hi ha un factor cr\u00edtic que rep menys atenci\u00f3:<strong> l\u2019escassetat de dades de qualitat<\/strong>.<\/span><\/p>\n<p><span>Durant anys s\u2019ha repetit la idea que vivim en una era d\u2019\u201cexc\u00e9s d\u2019informaci\u00f3\u201d. No obstant aix\u00f2, els models d\u2019IA no consumeixen qualsevol contingut: necessiten dades abundants, variades i, sobretot, de qualitat. I aquestes dades, especialment les p\u00fabliques i ben estructurades, s\u00f3n molt m\u00e9s escasses del que sembla.<\/span><\/p>\n<p><span>Algunes xifres que ajuden a dimensionar el problema:<\/span><\/p>\n<ul>\n<li><span><a href=\"https:\/\/arxiv.org\/pdf\/2005.14165\">GPT-3<\/a> va ser entrenat amb aproximadament <strong>300 mil milions<\/strong> de tokens.<\/span><\/li>\n<li><span><a href=\"https:\/\/www.databricks.com\/blog\/introducing-dbrx-new-state-art-open-llm\">DBRX<\/a>, de Databricks, ha estat entrenat amb m\u00e9s de <strong>12 bilions<\/strong> de tokens.<\/span><\/li>\n<\/ul>\n<p><span>Aquesta tend\u00e8ncia continua accelerant-se. Investigacions independents, com les d\u2019<a href=\"https:\/\/epoch.ai\/blog\/will-we-run-out-of-data-limits-of-llm-scaling-based-on-human-generated-data\">Epoch AI<\/a>, projecten que, si continuem a aquest ritme, podr\u00edem esgotar les fonts p\u00fabliques de text \u00fatil entre 2026 i 2032. Aquesta predicci\u00f3 ha estat recolzada per <a href=\"https:\/\/techcrunch.com\/2025\/01\/08\/elon-musk-agrees-that-weve-exhausted-ai-training-data\/\">Elon Musk, que ha assenyalat<\/a> p\u00fablicament que el coneixement disponible a la web ja no \u00e9s suficient per alimentar els models m\u00e9s grans.<\/span><\/p>\n<h2><span>No \u00e9s nom\u00e9s una q\u00fcesti\u00f3 de quantitat<\/span><\/h2>\n<p><span>En teoria, vivim envoltats de dades. En la pr\u00e0ctica, la major part s\u00f3n privades, propiet\u00e0ries o protegides per normatives. Registres m\u00e8dics, operacions banc\u00e0ries, documentaci\u00f3 empresarial, sistemes p\u00fablics\u2026 <strong>la major part del coneixement valu\u00f3s del m\u00f3n no \u00e9s lliure ni accessible<\/strong>, i per bones raons.<\/span><\/p>\n<p><span>Aquesta situaci\u00f3 ha generat una intensa compet\u00e8ncia per l\u2019acc\u00e9s a dades. Les grans companyies tecnol\u00f2giques competeixen per llic\u00e8ncies de contingut, els llocs web implementen restriccions al rastreig autom\u00e0tic (web scraping), i es negocien acords milionaris per l\u2019acc\u00e9s a bases de dades especialitzades. El resultat \u00e9s un mercat de dades cada vegada m\u00e9s tancat, cost\u00f3s i estrat\u00e8gic.<\/span><\/p>\n<h2><span>La resposta emergent: les dades sint\u00e8tiques<\/span><\/h2>\n<p><span>Davant la creixent dificultat d\u2019accedir a dades reals de qualitat, una alternativa est\u00e0 guanyant terreny a la ind\u00fastria: <strong>les dades sint\u00e8tiques<\/strong>. Aquestes dades no provenen de persones, empreses o registres reals, sin\u00f3 que s\u00f3n generades artificialment per models estad\u00edstics o sistemes d\u2019IA amb l\u2019objectiu de reproduir els patrons i comportaments de dades aut\u00e8ntiques.<\/span><\/p>\n<p><span>\u00c9s a dir, si entrenem un model amb un conjunt d\u2019historials cl\u00ednics, imatges m\u00e8diques o transaccions financeres, aquest model pot aprendre\u2019n les caracter\u00edstiques i despr\u00e9s crear nous exemples que s\u2019hi assemblin, per\u00f2 sense contenir informaci\u00f3 identificable. Aix\u00ed s\u2019aconsegueix un equilibri entre utilitat i privacitat.<\/span><\/p>\n<h3><span>Avantatges:<\/span><\/h3>\n<ul>\n<li><span><strong>Privacitat per disseny<\/strong>: permeten entrenar models sense exposar informaci\u00f3 sensible.<\/span><\/li>\n<li><span><strong>Escalabilitat<\/strong>: es poden generar milions d\u2019exemples en pocs minuts.<\/span><\/li>\n<li><span><strong>Simulaci\u00f3 de situacions poc comunes<\/strong>: permet entrenar models amb esdeveniments que rarament apareixen en dades reals, des d\u2019anomalies industrials fins a condicions m\u00e8diques infreq\u00fcents.<\/span><\/li>\n<li><span><strong>Reducci\u00f3 de costos<\/strong>: disminueix la necessitat de recollida manual o d\u2019anotaci\u00f3 extensa.<\/span><\/li>\n<\/ul>\n<h3><span>Riscos associats:<\/span><\/h3>\n<p><span>Existeix un fenomen conegut com a \u201c<strong>col\u00b7lapse del model<\/strong>\u201d (model collapse). Si entrenem nous models principalment amb dades generades per altres models, la diversitat disminueix. \u00c9s com <strong>fotocopiar una fotoc\u00f2pia<\/strong>: amb cada generaci\u00f3, es perd nitidesa.<\/span><\/p>\n<p><span>Aix\u00f2 pot provocar:<\/span><\/p>\n<ul>\n<li><span>Respostes m\u00e9s repetitives.<\/span><\/li>\n<li><span>Menys creativitat.<\/span><\/li>\n<li><span>Desconnexi\u00f3 amb la realitat del m\u00f3n.<\/span><\/li>\n<\/ul>\n<p><span>Per aix\u00f2, l\u2019\u00fas de dades sint\u00e8tiques ha d\u2019anar acompanyat de <strong>supervisi\u00f3 humana<\/strong> i combinat sempre amb dades reals seleccionades acuradament.<\/span><\/p>\n<h2><span>Estrat\u00e8gies per abordar l\u2019escassetat de dades<\/span><\/h2>\n<p><span>La ind\u00fastria est\u00e0 desenvolupant diversos enfocaments per gestionar aquesta limitaci\u00f3. En lloc de continuar escalant models cada cop m\u00e9s grans, moltes organitzacions opten per models m\u00e9s petits i especialitzats (Small Language Models o SLM), dissenyats per resoldre tasques espec\u00edfiques de manera m\u00e9s eficient.<\/span><\/p>\n<p><span>L\u2019entrenament multimodal tamb\u00e9 est\u00e0 prenent rellev\u00e0ncia: combinar text, imatges, \u00e0udio i v\u00eddeo curats acuradament permet aprofitar millor les dades disponibles. Paral\u00b7lelament, s\u2019estan establint marcs d\u2019atribuci\u00f3 de dades que permeten als creadors i organitzacions mantenir el control sobre com s\u2019utilitzen els seus continguts.<\/span><\/p>\n<p><span>Les dades sint\u00e8tiques continuaran tenint un paper important, per\u00f2 el seu \u00fas ha de ser responsable: requereix supervisi\u00f3 cont\u00ednua i avaluaci\u00f3 rigorosa per evitar tant la degradaci\u00f3 dels models com l\u2019amplificaci\u00f3 de biaixos. El repte \u00e9s real, per\u00f2 les solucions ja estan en marxa.<\/span><\/p>\n<h2><span>Conclusi\u00f3<\/span><\/h2>\n<p><span>La IA no dep\u00e8n nom\u00e9s de models m\u00e9s grans o de maquinari m\u00e9s potent: <strong>dep\u00e8n de les dades que l\u2019alimenten<\/strong>. I aquestes dades ja no s\u00f3n infinites.<\/span><\/p>\n<p><span>El futur de la IA no es jugar\u00e0 \u00fanicament en els algoritmes, sin\u00f3 en <strong>com recollim, estructurem, protegim i combinem les dades<\/strong>. Les organitzacions que entenguin aquesta din\u00e0mica \u2014empreses, governs i investigadors\u2014 tindran un avantatge competitiu significatiu en els pr\u00f2xims anys.<\/span><\/p>\n","protected":false},"excerpt":{"rendered":"<p>La gran sequera de dades en la intel\u00b7lig\u00e8ncia artificial<\/p>\n","protected":false},"author":1,"featured_media":19516,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"footnotes":"","_members_access_role":[],"_members_access_error":""},"categories":[35],"tags":[],"class_list":["post-16174","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-noticies-partner"],"acf":[],"_links":{"self":[{"href":"https:\/\/festibity.com\/es\/wp-json\/wp\/v2\/posts\/16174","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/festibity.com\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/festibity.com\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/festibity.com\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/festibity.com\/es\/wp-json\/wp\/v2\/comments?post=16174"}],"version-history":[{"count":1,"href":"https:\/\/festibity.com\/es\/wp-json\/wp\/v2\/posts\/16174\/revisions"}],"predecessor-version":[{"id":17585,"href":"https:\/\/festibity.com\/es\/wp-json\/wp\/v2\/posts\/16174\/revisions\/17585"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/festibity.com\/es\/wp-json\/wp\/v2\/media\/19516"}],"wp:attachment":[{"href":"https:\/\/festibity.com\/es\/wp-json\/wp\/v2\/media?parent=16174"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/festibity.com\/es\/wp-json\/wp\/v2\/categories?post=16174"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/festibity.com\/es\/wp-json\/wp\/v2\/tags?post=16174"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}