Dos comptadors poden discrepar sobre el mateix text sense que cap tingui un error aritmètic. Potser compten unitats diferents, tracten la puntuació d'una altra manera o reben contingut diferent del porta-retalls. Una comparació útil comença per identificar la mètrica i conservar l'entrada exacta. L'etiqueta «caràcters» no defineix per si sola com es mesura.
El comptador de paraules i caràcters mostra paraules, caràcters amb espais en blanc i sense, paràgrafs i una estimació de lectura. Aquesta guia fa servir un exemple multilingüe petit per examinar cada resultat i aplicar després el mateix mètode a un lliurament editorial, una traducció o una previsió de temps de lectura.
Identifica el límit que has de complir
Imagina que una publicació demana un article amb un màxim de paraules i una introducció amb límit de caràcters. Abans de retallar l'esborrany, aclareix si les paraules inclouen títol, peus d'imatge, referències o navegació. Un comptador analitza el text rebut; no pot deduir les fronteres editorials de la publicació. Copia només la part acordada i conserva a part el document complet.
Per a la introducció, esbrina què entén el destí per caràcter. Pot limitar bytes, unitats d'una cadena JavaScript, punts de codi Unicode o unitats percebudes visualment. UtilX empra grafemes quan disposa del segmentador. És una mesura útil per al text adreçat a lectors, però no garanteix l'acceptació en un destí amb una altra regla.
Anota el límit, la mètrica triada i la versió exacta de l'esborrany. Així converteixes una discussió sobre dos nombres sense explicació en una comparació reproduïble. També evites que una modificació posterior del títol canviï silenciosament l'abast del lliurament.
Comprova llengües, accents i un emoji compost
Enganxa aquest text exacte, conserva la línia en blanc i no afegeixis cap salt al final:
Hola món café Grüße 👨👩👧👦
Una idea.
Amb el mètode normal, el resultat és sis paraules, 32 caràcters, 25 caràcters sense espais en blanc i dos paràgrafs. La lectura estimada és de dos segons. S'han comprovat aquests resultats amb les cinc configuracions regionals de l'eina: castellà, anglès, català, portuguès i alemany.
L'emoji familiar aporta un grafema al resultat normal, malgrat estar format per diversos punts de codi Unicode. No compta com a paraula. Els sis segments considerats paraules són Hola, món, café, Grüße, Una i idea. El punt final aporta un caràcter, però no una paraula addicional.
L'exemple conté cinc espais ordinaris i dos salts de línia. Excloure aquestes set unitats explica la diferència entre 32 i 25. La línia buida separa els dos paràgrafs. Si copies un altre salt al final, pot canviar el total de caràcters encara que les paraules i el nombre de paràgrafs siguin els mateixos.
Compara mesures sense alterar les proves
Obre el comptador en el teu idioma, enganxa l'exemple i comprova totes les mètriques abans de provar l'esborrany. Observa si la pàgina indica el mètode normal o una alternativa aproximada. Desa aquesta informació amb els resultats, perquè una diferència de segmentació pot explicar allò que inicialment sembla un error de càlcul.
Després enganxa la part acordada del teu text. No eliminis puntuació, col·lapsis espais ni reescriguis salts només per obtenir el nombre d'un altre editor. Conserva l'original i canvia una sola cosa cada vegada en una còpia de treball. Si treure el títol explica la diferència, has trobat un problema d'abast, no de segmentació.
Per investigar caràcters, prova separadament una paraula senzilla, una d'accentuada i un emoji compost. Per als paràgrafs, substitueix un salt simple per una línia buida i observa la mètrica. Per a les paraules, aïlla la puntuació o el sistema d'escriptura relacionat amb la discrepància, en lloc d'enganxar repetidament el document sencer.
Abans del lliurament, aplica la regla del destí real. Desa junts el text final i el recompte. Un resultat obtingut abans de l'última correcció no demostra que la versió definitiva continuï respectant el límit demanat.
Entén què representa cada unitat
El recompte normal de paraules utilitza Intl.Segmenter amb la configuració regional de la pàgina i compta segments marcats com isWordLike. Els espais i signes poden formar segments sense ser paraules. L'especificació d'internacionalització d'ECMAScript defineix aquesta interfície; no estableix els paràgrafs ni la velocitat de lectura escollida per UtilX.
Els caràcters se segmenten en grafemes, una aproximació pràctica al caràcter percebut per una persona. Una lletra amb una marca combinant o una seqüència d'emojis units pot constituir una unitat. La segmentació de text d'Unicode explica per què això difereix de comptar valors codificats. La unitat visual i la mida d'emmagatzematge responen a preguntes diferents.
El total de caràcters inclou espais en blanc. La segona mètrica exclou també tabulacions i salts, no només espais ordinaris visibles. Els paràgrafs són blocs no buits separats per línies en blanc. Un salt simple dins del bloc no crea un altre paràgraf; les línies buides finals tampoc inventen paràgrafs addicionals.
La lectura estimada utilitza una convenció: 200 paraules per minut. Per a sis paraules, el càlcul dona 1,8 segons i l'estimació entera mostrada és de dos. Serveix com a referència de planificació, no com a mesurament de la velocitat d'una persona concreta.
Explica la discrepància abans de retallar
Si un altre editor atribueix més caràcters a l'emoji familiar, potser compta punts de codi o unitats UTF-16. Això no converteix l'emoji en diversos símbols visibles. A la inversa, un total de grafemes no prova que una columna de base de dades o una petició de xarxa admeti el text. Consulta la unitat documentada pel receptor.
Si els paràgrafs difereixen, examina les línies buides i no l'ajust visual de l'àrea de text. Una finestra estreta pot mostrar un paràgraf en moltes línies de pantalla sense introduir salts al contingut. Un document copiat també pot contenir separacions que no eren evidents en el disseny original.
Si les paraules difereixen, revisa idioma, puntuació i contingut inclòs. Una URL, un apòstrof o una expressió amb guionet poden mostrar regles diferents. No prometis coincidència entre tots els editors perquè l'exemple senzill coincideixi. Compara el fragment més petit que conservi el problema i comunica el mètode al costat del nombre.
Mantén visibles la llengua i la finalitat editorial
L'eina utilitza les configuracions es, en, ca, pt i de. Segmentar segons la llengua és millor que suposar una paraula per espai ordinari, però no equival a avaluar lingüísticament el text. La prosa multilingüe, els noms propis i els identificadors tècnics continuen necessitant criteri editorial.
Quan revisis una traducció, comprova primer si conté totes les idees necessàries. Un compost alemany i la seva traducció anglesa de diverses paraules poden expressar el mateix amb totals diferents. Una traducció més curta no és necessàriament incompleta, i dos recomptes iguals tampoc demostren equivalència de significat.
Per estimar la lectura, considera l'ús del material. Llegir per sobre un avís conegut no és com estudiar codi, seguir instruccions o llegir en veu alta. Utilitza les 200 paraules com a base coherent i deixa marge per a la tasca real. No presentis l'estimació com un termini que cada lector hauria de complir.
Reconeix quan el resultat és aproximat
L'entrada està limitada a 1 MiB de text UTF-8. És un límit de bytes, no una promesa d'acceptar un milió de caràcters visibles. Accents i emojis poden necessitar diversos bytes, de manera que textos amb els mateixos grafemes poden ocupar espais diferents. Divideix un document més gran en seccions significatives i conserva'n els límits quan comparis.
Si Intl.Segmenter no està disponible, la pàgina identifica el mètode alternatiu com a aproximat. Utilitza un patró de paraules compatible amb Unicode i compta punts de codi per als caràcters. Els emojis compostos poden aportar diverses unitats; el familiar de l'exemple conté set punts de codi. No comparis aquest resultat amb grafemes com si mesuressin el mateix.
El comptador no avalua claredat, originalitat, correcció gramatical ni compliment de normes editorials. El càlcul es fa localment al navegador, sense necessitat de pujar l'esborrany. Conserva el document a part: una pàgina de recompte no substitueix un sistema de gestió documental ni l'historial de canvis.
Acompanya el nombre final amb el mètode
Abans de comunicar un recompte, confirma abast exacte, llengua, mètode de segmentació, tractament dels espais en blanc i criteri de paràgrafs. Verifica si el límit del destí fa servir la mateixa unitat. Conserva l'esborrany final amb el resultat i repeteix el càlcul després de qualsevol canvi d'última hora.
Per a l'exemple fix, exigeix sis paraules, 32 grafemes, 25 sense espais en blanc, dos paràgrafs i dos segons amb el mètode normal. Fes servir les diferències com a pistes de diagnòstic. L'objectiu és una mesura que una altra persona pugui reproduir i interpretar, no un nombre sense explicació que simplement sembli acceptable.
Fonts: especificació d'internacionalització d'ECMAScript: Segmenter i annex estàndard Unicode #29: segmentació de text.