FS-DFM d'Apple davant de Copilot: la batalla per la IA generativa

  • FS-DFM proposa un model de difusió en pocs passos que genera text llarg fins a 128 vegades més ràpid que sistemes autoregressius, mantenint una qualitat competitiva.
  • Apple planeja integrar aquesta tecnologia a Siri, Apple Intelligence, iWork i Xcode, mentre Microsoft reforça Copilot amb nous models com MAI-Voice-1 i MAI-1-preview.
  • Copilot ja ofereix de manera estable generació avançada de text, imatges i veu, amb integració profunda a Microsoft 365 i un model de subscripció consolidat.
  • L'èxit d'Apple dependrà de com combini FS-DFM i futurs models tipus AppleGPT amb una integració real i útil a iOS, macOS i les seves eines professionals.

FS-DFM Apple vs Copilot

En els darrers mesos, la carrera per la intel·ligència artificial generativa s'ha posat al vermell viu, i ara entra en escena un nou actor amb accent de Cupertino: el model FS-DFM d'Apple, pensat per generar text llarg a una velocitat brutal . Mentre que Microsoft reforça Copilot amb nous models i Google segueix trepitjant l'accelerador, Apple intenta retallar distàncies amb una tecnologia que, sobre el paper, promet ser una autèntica revolució.

Aquest context no és menor: parlem d'un sector on cada segon compte i on la qualitat del text, la capacitat de seguir instruccions i la integració amb eines del dia a dia són claus. En aquest escenari, cal preguntar-se amb calma: realment pot FS-DFM competir amb Copilot i els models que el potencien , o arriba massa tard a una festa que ja està molt avançada?

Què és FS-DFM i per què està donant tant a parlar?

Un grup d'enginyers d'Apple, en col·laboració amb la Universitat Estatal d'Ohio, ha presentat FS-DFM (Few-Step Discrete Flow-Matching) , un nou model de llenguatge dissenyat específicament per generar text llarg de manera extremadament ràpida sense degradar la qualitat. Segons l'estudi publicat, FS-DFM és capaç de generar seqüències llargues fins a 128 vegades més ràpidament que els models autoregressius tradicionals de l'estil ChatGPT, mantenint un nivell de qualitat equiparable.

Aquest model se centra en la generació de text eficient i estable, fins i tot en passatges extensos , la qual cosa el converteix en un dels enfocaments més interessants que hem vist per a tasques on la latència és crítica: assistents conversacionals en temps real, redacció de documents, respostes llargues en aplicacions de productivitat i, en general, qualsevol cas en què l'usuari no vulgui esperar que el text vagi.

Com funciona FS-DFM: de l'enfocament autoregressiu a la difusió a pocs passos?

Els models clàssics de llenguatge del tipus GPT utilitzen un esquema autoregressiu: generen text token a token, paraula a paraula , calculant a cada pas quina és la següent unitat de text més probable. Aquest enfocament ofereix molt bon control i qualitat, però és intrínsecament seqüencial: cada nou token depèn de l'anterior, cosa que limita la velocitat, sobretot quan parlem de textos llargs.

diferències entre Smart, Quick Response, Think Deeper, Study an Learn i Search de Copilot
Article relacionat:
Copilot: diferències entre Smart, Quick Response, Think Deeper, Study an Learn i Search

FS-DFM trenca aquesta filosofia en inspirar-se en els models de difusió, que s'han fet famosos en la generació d'imatges . En lloc d'anar-hi paraula per paraula, el model genera diversos fragments de text en paral·lel i els va refinant en successives iteracions. El text inicial pot ser sorollós, incoherent o incomplet, però a cada ronda de millora el model corregeix, reorganitza i poleix el resultat per acostar-lo a una sortida final d'alta qualitat.

Apple no es limita a copiar la difusió clàssica, sinó que aplica una tècnica coneguda com a flow-matching, que accelera el procés eliminant bona part de les iteracions intermèdies . En comptes de fer centenars o milers de petits passos de refinament, FS-DFM aprèn a donar “canyes” més llargues a l'espai de possibles textos, de manera que convergeix en molt poques rondes cap a un text coherent i fluid.

La clau d‟aquest enfocament de pocs passos és que el model aprèn a navegar directament entre el “soroll” inicial i el text final sense haver de recórrer totes les etapes intermèdies típiques de la difusió estàndard. Això redueix dràsticament el temps de generació mantenint una estructura global del text sòlida, cosa especialment valuosa quan cal produir paràgrafs llargs o documents sencers.

Les tres fases de l'entrenament de FS-DFM

Perquè aquest esquema funcioni, l'equip d'Apple i la Universitat Estatal d'Ohio ha dissenyat un procés d'entrenament en tres etapes que cerca equilibrar velocitat, estabilitat i precisió lingüística . No és únicament qüestió de llançar un model de difusió i esperar el millor, sinó de guiar-lo amb cura perquè aprengui a escriure bé amb molt pocs passos.

A la primera fase, el model aprèn a operar amb diferents nombres d'iteracions de refinament . Això permet que FS-DFM s'adapti tant a escenaris on preval la rapidesa extrema com a d'altres on es pot permetre algun pas extra per polir millor el resultat, entrenant la seva capacitat de millora progressiva del text segons la quantitat de passos disponibles.

La segona fase introdueix un model mestre (un “teacher” més gran i potent) que guia a FS-DFM . Aquest model d'ensenyament actua com a referència de qualitat, proporcionant exemples i correccions que ajuden FS-DFM a afinar detalls més subtils: elecció de paraules, coherència semàntica, estil, consistència en textos extensos… D'aquesta manera, el model més lleuger aprèn a apropar el rendiment d'un sistema molt més gran.

Finalment, a la tercera fase, s'optimitzen els passos individuals de refinament per aconseguir una convergència més ràpida i estable . La idea és que, en cadascuna d'aquestes poques iteracions, el model aprofiti al màxim la informació disponible, redueixi el soroll de manera intel·ligent i mantingui l'estructura del text sense introduir errors sobtats o salts de tema estranys.

Velocitat sense sacrificar qualitat: proves davant de Dream i LLaDA

Un dels aspectes més cridaners de l'estudi és que FS-DFM és capaç de generar un text complet en gairebé vuit iteracions molt ràpides . Mentrestant, altres models de difusió per a llenguatge arriben a necessitar més de mil passes per refinar el contingut fins a un nivell raonable. La diferència en latència és abismal, sobretot si pensem en dispositius personals com ara un iPhone o un Mac.

A les comparatives, FS-DFM s'enfronta a models de difusió més grans com Dream (amb 7.000 milions de paràmetres) o LLaDA (amb 8.000 milions de paràmetres) . Tot i comptar amb menys paràmetres, el model d'Apple obté millors resultats en dues mètriques fonamentals en processament de llenguatge: la perplexitat i l'entropia, que serveixen per mesurar com és de natural i estable el text generat.

Una perplexitat més baixa indica que el model prediu millor les seqüències de paraules reals , és a dir, que el llenguatge que produeix s'assembla més al d'un humà. Alhora, una entropia més estable suggereix que el model manté un equilibri sa entre creativitat i consistència, sense tornar-se caòtic ni repetitiu en excés. En tots dos fronts, FS-DFM mostra un avantatge clar sobre aquests models de difusió més voluminosos.

Aquest resultat és especialment rellevant si tenim en compte que, en dispositius amb recursos limitats, un model més petit i ràpid que mantingui una qualitat competitiva pot ser molt més útil que un gegant que només pot funcionar a grans centres de dades. Aquí és on Apple vol marcar la diferència de cara als seus productes i serveis.

Publicació de l'estudi i l'obertura a la comunitat investigadora

FS-DFM Apple vs Copilot

El treball que descriu FS-DFM s'ha publicat a arXiv sota el títol “FS-DFM: Fast and Accurate Long-Text Generation per Few-Step Diffusion Language Models” o similar, on es detallen tant l'arquitectura com el procés d'entrenament i les avaluacions davant d'altres models. L'article inclou, a més, exemples concrets que mostren com canvia i millora el text generat al llarg de les diferents iteracions.

Apple ha expressat la seva intenció d' alliberar el codi i els checkpoints (punts de control) del model , cosa que permetria a investigadors i desenvolupadors experimentar amb FS-DFM, adaptar-lo a nous dominis o integrar-lo a les seves pròpies aplicacions. Per a un entorn tradicionalment tancat com el d'Apple, aquest moviment es pot interpretar com una manera de guanyar rellevància a la comunitat científica d'IA.

Si aquest enfocament de difusió en pocs passos es consolida, es podria convertir en un estàndard de facto per a generació de text en sistemes on el temps de resposta és crític . És justament en aquest tipus d'escenaris on Apple vol brillar amb els seus propis assistents i eines de productivitat.

FS-DFM a l'ecosistema Apple: Siri, Apple Intelligence i iWork al punt de mira

La gran aposta d'Apple passa per integrar FS-DFM (o models derivats) al seu ecosistema, especialment a Siri, a les funcions d'Apple Intelligence ia la suite iWork . Si un model capaç de redactar ràpid i bé sexecuta amb baixa latència en iPhone, iPad i Mac, lexperiència dusuari podria fer un salt considerable respecte al que tenim avui.

A Siri, un model d'aquest tipus permetria respostes més elaborades, contextuals i ràpides , allunyant-se de l'assistent limitat i una mica maldestre que molts usuaris perceben actualment. A Apple Intelligence, les funcions de redacció assistida, correcció d'estil o generació de resums es podrien beneficiar enormement de poder produir paràgrafs llargs sense temps d'espera molestos.

Dins iWork, eines com Pages, Numbers o Keynote podrien rebre un impuls notable si s'integren funcions generatives que ajudin a redactar documents, proposar presentacions o estructurar dades . De fet, la compra recent del domini iWork.ai per part d'Apple alimenta les especulacions sobre una arribada massiva de característiques d'IA generativa a aquest paquet d'ofimàtica.

Com es posiciona Microsoft: Copilot i els nous models MAI-Voice-1 i MAI-1-preview

Mentre Apple perfecciona FS-DFM, Microsoft no es queda quieta. La companyia ha anunciat dos nous models d'IA estretament vinculats a Copilot: MAI-Voice-1 i MAI-1-preview . El seu objectiu és mantenir Copilot com a referència en assistents de productivitat i ampliar-ne encara més les capacitats.

MAI-Voice-1 és un model de generació de veu que destaca per la seva velocitat extrema . Microsoft afirma que pot produir un minut d'àudio en menys d'un segon usant una sola GPU, cosa que el fa especialment atractiu per a aplicacions en temps real: narració de textos, lectura de correus, podcasts generats al vol o assistents de veu més naturals.

Aquest model de veu ja es troba integrat a Copilot Daily ia la funció de Podcasts , i Microsoft ha començat a desplegar-lo també a Copilot Labs, de manera que els usuaris puguin provar-ho directament des de les eines existents sense esperar futurs llançaments massius.

D'altra banda, MAI-1-preview és un model de tipus MoE (Mixture of Experts) entrenat amb al voltant de 15.000 GPU NVIDIA H100 . Està orientat a seguir instruccions de forma precisa ia oferir respostes útils i directes a preguntes quotidianes, una cosa molt alineada amb l'ús principal de Copilot com a assistent de tasques i consulta d'informació.

Microsoft planeja integrar de forma parcial aquest model a Copilot les properes setmanes , reforçant així les capacitats de l'assistent tant en la comprensió de les peticions de l'usuari com en la generació de respostes més adaptades al context i al to sol·licitat.

Copilot: model de negoci, avantatges i límits davant d'Apple

Una peça clau del puzle és el model daccés. Tot i que Copilot compta amb una versió gratuïta accessible a qualsevol usuari , el seu veritable potencial es desbloqueja amb la subscripció Copilot Pro, que té un cost de 22 euros al mes.

com activar Copilot+ al Windows
Article relacionat:
Domina la cerca semàntica amb l'assistent Copilot

Amb Copilot Pro, els usuaris obtenen accés prioritari als models d'IA més recents i la integració profunda amb Microsoft 365 : Word, Excel, PowerPoint, Outlook i altres eines. Per a empreses, això suposa poder automatitzar tasques de redacció, anàlisi de dades, generació de presentacions i gestió de correu de manera molt més eficient.

En paral·lel, Google ofereix el seu propi servei de pagament, Google AI Pro, amb un preu de 21,99 euros al mes , que afegeix a més 2 TB d'emmagatzematge a Fotos, Drive i Gmail. La competència, per tant, no només és tecnològica, sinó també en models de negoci, preus i valor afegit per a l'usuari final.

Davant d'això, Apple es troba en una situació delicada: encara no compta amb un assistent generatiu públic de l'envergadura de Copilot i el seu enfocament tradicionalment més tancat complica l'adopció ràpida de models de subscripció similars. Tot i així, la integració nativa en dispositius i sistemes pot ser la seva gran carta si aconsegueix oferir funcions d'IA útils sense obligar l'usuari a contractar un altre servei mensual més.

Microsoft Copilot al món Apple: un convidat incòmode

La relació entre Microsoft i Apple és, des de fa anys, una barreja de rivalitat i col·laboració pragmàtica . Office porta temps sent un ciutadà de ple dret a macOS i iOS, i ara també Copilot ha aterrat a Mac i iPhone com una aplicació perfectament funcional.

Aquest moviment converteix Copilot en una arma competitiva molt potent dins de l'ecosistema Apple , precisament on la companyia de Cupertino està més fluixa en termes d'IA generativa visible. Copilot es presenta com un assistent potent i, en la seva versió bàsica, gratuït, fet que suposa una pressió clara per a Apple, que fins ara no ofereix res equivalent a aquesta escala.

És cert que Apple fa anys que utilitza tècniques d'IA sota el paraigua del “machine learning” per millorar l'experiència en els dispositius . Els suggeriments intel·ligents d'aplicacions en obrir el cercador, l'autocompletat de frases o el reconeixement de patrons en l'ús diari d'iOS i macOS es recolzen en models d'aprenentatge automàtic, encara que Apple rares vegades els etiqueti com a “intel·ligència artificial”.

Aquesta IA també es nota en aspectes més visibles, com ara la millora automàtica de les fotografies, la creació de stickers a partir d'imatges o l'eliminació del fons en qüestió de segons . No obstant això, un model que competeixi de tu a tu amb GPT-4, DALL·E 3 o les funcions completes de Copilot continua sent el gran buit en allò generatiu.

Què ofereix Copilot avui que Apple encara no iguala?

Copilot es pot descriure com un chatbot avançat amb capacitats generatives tant de text com d'imatge , alimentat per la tecnologia d'OpenAI (GPT-4 i DALL·E 3) però empaquetat i estès per Microsoft amb la seva pròpia capa de serveis i funcionalitats.

Un dels seus grans avantatges és que està permanentment connectat a Internet i pot accedir a informació actualitzada . D'aquesta manera, podeu respondre preguntes sobre temes recents, oferir dades revisades i enllaçar a fonts rellevants, una cosa molt apreciada quan es busca informació puntual i no només generació de contingut estàtic.

Al terreny visual, Copilot permet generar imatges a partir de prompts en llenguatge natural , de la mateixa manera que els generadors d'imatges més coneguts. El sistema suggereix variacions i modificacions de les imatges creades, com ara canviar elements de l'escena, ajustar l'estil visual o transformar detalls específics (per exemple, canviar el foc d'un drac per aigua o situar l'escena en un castell).

Pel que fa al text, Copilot és capaç de redactar històries, resumir documents, respondre consultes complexes o generar codi en múltiples llenguatges de programació. També proposa exemples, explicacions addicionals i enllaços a recursos com Wikipedia per aprofundir en els conceptes que va tractant.

Tot això fa que, avui dia, molts usuaris de dispositius Apple recorrin directament a Copilot o ChatGPT per a tasques que Apple encara no cobreix amb les seves pròpies eines , generant la sensació que la companyia va alguna cosa a remolc en aquesta carrera concreta.

El futur d'Apple: AppleGPT, iOS 18 i l'aposta per la IA generativa

Els rumors i filtracions apunten que Apple prepara un salt important amb iOS 18 i macOS 15 pel que fa a intel·ligència artificial generativa. Es parla internament d'un projecte anomenat AppleGPT o Ajax, un model de llenguatge propi que es podria integrar en múltiples capes del sistema operatiu.

La gran incògnita és fins a quin punt aquest futur model serà capaç de competir amb OpenAI, Microsoft o Google en qualitat, versatilitat i velocitat. La carrera per la IA no va començar ahir: fa anys que està en marxa i es va disparar el 2023, de manera que Apple arriba a un escenari on la competència ja té productes sòlids al mercat.

El que sí que sembla clar és que Apple pretén inundar les seves plataformes de funcions impulsades per IA . Craig Federighi, màxim responsable de programari a la companyia, hauria ordenat incorporar “totes les funcions amb IA que es puguin” en les futures versions de iOS, iPadOS i macOS, cosa que inclou tant utilitats per a usuaris finals com eines avançades per a desenvolupadors.

Xcode amb IA: el “Copilot” que Apple vol per als seus desenvolupadors

Una de les àrees on Apple planeja posar molt èmfasi és en les seves plataformes de desenvolupament, especialment Xcode . Segons informació avançada per Mark Gurman, la companyia porta al voltant d'un any provant internament funcions d'IA generativa dins de Xcode que permetin generar blocs de codi font automàticament , molt en la línia del que ja fa GitHub Copilot en altres entorns.

La idea no és que l'assistent faci tota la feina del programador, sinó agilitzar tasques repetitives, suggerir solucions i ajudar els qui estan aprenent . Molts desenvolupadors ja usen eines com ChatGPT per resoldre dubtes concrets, i Apple no vol que el seu entorn de desenvolupament es quedi fora d'aquesta tendència.

L'objectiu seria poder mostrar aquestes novetats en una propera WWDC, obrint la porta que la comunitat de desenvolupadors comenci a provar-les . Si FS-DFM o models relacionats s'integren bé amb Xcode, podrien oferir generació i refactorització de codi amb molt baixa latència, cosa molt valuosa quan es treballa de forma intensiva en projectes grans.

En paral·lel, la compra del domini iWork.ai per part d'Apple reforça la idea que Pages, Numbers i Keynote rebran també funcions generatives que aprofitin els avenços interns a IA, tancant així el cercle entre productivitat, desenvolupament i experiència d'usuari a l'ecosistema de la marca.

Copilot a PowerPoint
Article relacionat:
Copilot a PowerPoint: com dissenyar presentacions amb IA de forma àgil i fiable

Vist tot aquest panorama, la sensació és que FS-DFM és una peça tècnica clau en l'estratègia d'Apple per “posar-se al dia” a IA generativa , mentre Microsoft i Google continuen avançant amb productes ja consolidats com Copilot i els seus nous models de suport, de manera que la gran batalla no serà només qui té el model més ràpid, sinó qui l'integra millor a la vida diària. Comparteix la informació i més persones estaran assabentades del tema.


Afegir com a font preferida a Google